Qwen показала Qwen3.8-Flash и раскрыла архитектуру будущего Qwen4

Wait 5 sec.

Alibaba представила Qwen3.8-Flash — мультимодальную MoE-модель с упором на высокую эффективность инференса и одновременно показала раннюю версию архитектуры, которая станет основой следующего поколения Qwen4.Основная модель содержит 125 млрд параметров, из которых на каждом токене активируется только около 6 млрд. Дополнительно используется 51 млрд параметров N-gram embeddings — отдельная таблица эмбеддингов, которая дополняет основную модель. Здесь важно различать размер основной MoE-модели и дополнительный параметрический блок: это не просто 176 млрд параметров модели в обычном смысле.Контекстное окно Qwen3.8-Flash составляет 262 тыс. токенов. Через YaRN его можно расширять до 1 млн токенов. Сама модель мультимодальная и рассчитана не только на текстовые, но и на визуальные задачи.Главная новизна — архитектура. Qwen сочетает Gated DeltaNet (GDN) с новым вариантом разреженного внимания Qwen Sparse Attention (QSA). Такой hybrid attention должен снизить стоимость обработки длинного контекста по сравнению с использованием полного attention на всех слоях.В архитектуру также добавлены Gated Residual, N-gram Embedding и новый для этой линейки вариант оптимизатора Muon. Qwen позиционирует эти изменения не как точечные улучшения Qwen3, а как набор архитектурных решений, которые будут использоваться в следующем поколении моделей.Отдельно команда подчеркивает эффективность обучения: по заявлению Qwen, стоимость подготовки Qwen3.8-Flash-Next составила примерно одну девятую от сопоставимого обучения Qwen3.7-Plus. При этом разработчики заявляют сопоставимый общий уровень возможностей и более сильные результаты в кодинге и задачах типа cowork. Читать далее