Transformer с полной пропускной способностью: скрытое состояние возвращается в модель.
Мы обратили внимание на новую работу, где Transformer получает возможность использовать скрытое состояние более полно. Обычно Transformer передаёт на следующий шаг только выбранный токен, хотя сама модель только что вычислила гораздо более богатое скрытое состояние.
В этой работе скрытое состояние тоже подаётся обратно в модель. За счёт этого она может продолжать внутренне развивать идею, не расписывая всё токен за токеном.
На масштабе 1 млрд параметров подход улучшает результаты в математике, программировании и тестах языковых моделей, добавляя менее 1% к стоимости декодирования.
При этом модель может показывать результаты на уровне моделей, обученных примерно на вдвое большем объёме данных.

