В будущей модели Astra OpenAI использует архитектурный прием recurrent depth, также известный как looped transformer. Вместо того чтобы каждый слой обрабатывать вход один раз, модель многократно прогоняет представление через одни и те же вычислительные блоки перед генерацией следующего токена. Это позволяет увеличить «глубину вычислений» без пропорционального наращивания числа параметров.У подхода есть два очевидных преимущества. Меньшая по размеру модель может выполнять больше вычислений над сложной задачей, а повторное использование одних и тех же слоев позволяет сократить требования к памяти и пропускной способности по сравнению с простым увеличением размера модели. Исследования подобных методов уже показывали улучшения на задачах программирования и математики.Но есть и проблема с наблюдаемостью размышлений (reasoning). В обычных «думающих» моделях значительная часть рассуждений выражается в виде текстовой цепочки мыслей. При recurrent depth дополнительные вычисления происходят внутри повторяющихся проходов по скрытым представлениям, поэтому значительная часть процесса оказывается менее доступна для внешнего анализа. Читать далее