Ифан Чжан, исследователь из Принстона, предложил новую архитектуру трансформеров под названием Recurrent Looped Transformer (RLT). Эта модель позволяет переносить финальное скрытое состояние декодера и кэш внимания на следующий токен, что устраняет необходимость сброса на границе между запросом и ответом. Это решение направлено на улучшение взаимодействия между токенами, что является значительным шагом вперед в области обработки естественного языка.
В RLT используется причинный энкодер в сочетании с рекуррентным декодером. Энкодер обрабатывает токены параллельно с помощью причинной маски и создает представления, из которых проецируется память ключ-значение. Это позволяет группам памяти делиться между слоями декодера, что потенциально может улучшить эффективность работы модели.
Предложение RLT является спецификацией дизайна, которая определяет архитектуру и графики выполнения, однако не предоставляет измерений эффективности или качества рассуждений. Это исследование может открыть новые горизонты в области обучения моделей и их применения в различных задачах, связанных с обработкой языка.