Moonshot AI выпустила веса Kimi K3 — мультимодальной MoE‑модели с 2,8 трлн параметров, из которых на каждом токене активируются 104 млрд. В отдельных тестах программирования и работы с инструментами K3 обходит Claude Opus 4.8, GPT-5.5, GPT-5.6 Sol или Claude Fable 5. Однако сводить релиз к таблице результатов было бы ошибкой: сама Moonshot признаёт в техническом отчёте, что в среднем модель уступает Fable 5 и GPT-5.6 Sol.Как следует из технического блога Moonshot, все решения K3 проектировались совместно: гибрид Kimi Delta Attention и глобального MLA, Attention Residuals, MoE на 896 экспертов, обучение длинных агентных траекторий и отдельная система кеширования. Разберём, какие задачи решает каждый компонент, что подтверждено опубликованными материалами и где отчёту Moonshot пока приходится верить на слово. Читать далее