Сегодня мы открываем веса нашей новой модели AliceAI‑Foundation-80B‑A3B‑Base под лицензией Apache 2.0. Модель прошла полный цикл обучения в Яндексе с нуля: мы не использовали веса сторонних опенсорс‑моделей. Её создание — ещё один шаг к нашей единой рассуждающей модели (ЕРМ), на базе которой будут развиваться агентские возможности Алисы AI.В претрейн‑замерах новая модель обходит более крупные DeepSeek‑V4-Flash‑Base и Nemotron-3-Super на многих задачах — от фактологических и экспертных вопросов до математики и кода, — а на сложных задачах IMO AnswerBench и LiveCodeBench лидирует среди сравниваемых открытых претрейнов. Нашу предыдущую закрытую Alice AI LLM 235B она превосходит по фактологическим знаниям, математике, программированию и работе с длинным контекстом — при почти втрое меньшем общем числе параметров и примерно в семь раз меньшем числе активных.Недавно наши коллеги открыли претрейн Alice AI Search (кстати, он тоже обучен без применения весов опенсорс‑моделей) и рассказали, как устроена модель быстрых ответов Алисы на Поиске. Сегодня мы подхватим у них эстафетную палочку и расскажем о большом обновлении датасета, который лежал в основе обучения обеих моделей.Также продолжим историю из декабрьского техрепорта Alice AI LLM. Тогда обучение начиналось с весов Qwen3-235B‑A22B, но в этот раз мы обучали модель полностью с нуля. Благодаря накопленному командой опыту весь путь к релизу этой модели занял около полугода. За это время мы пересобрали корпус, перебрали архитектурные решения, подобрали гиперпараметры и добавили данные для рассуждений и агентских взаимодействий.За итоговыми скорами стоит много экспериментов, и нам хочется рассказать о них подробно. Поэтому вместе с весами мы публикуем большой технический отчёт: от пайплайнов подготовки данных и протоколов оценки до стабилизации обучения и scaling laws. Для ключевых решений приводим абляционные эксперименты и разбираем подходы, от которых пришлось отказаться. Вклад обновлённого корпуса, архитектуры и гиперпараметров проверили в серии обучений с нуля — по 2 трлн токенов каждое.Отдельная большая часть отчёта посвящена тому, как измерять качество претрейнов и почему это сложно. Результат базовой модели может сильно зависеть от примеров в промпте, а правильное решение сложной задачи — появляться лишь в одной из многих попыток. Мы подробно рассказываем, как выбирали протоколы замеров, строили бенчмарки, проверяли автоматическую оценку и выясняли, какие метрики позволяют предсказать качество после дообучения. Вместе с весами открываем два фактологических бенчмарка — WikiWebFacts и HardMultiQA с акцентом на русскоязычный контекст — и протоколы их оценки. Читать далее