DeepSeek V4.1-Flash: новая архитектура, 552 млрд параметров и агентные тесты

Wait 5 sec.

DeepSeek вывела V4.1-Flash — младшую модель новой архитектурной линейки компании. Это MoE-модель на 552 млрд параметров с нативной поддержкой изображений, контекстом до 1 млн токенов и отдельными режимами reasoning.Наиболее интересная часть релиза — архитектурные изменения. DeepSeek перешла к асимметричной схеме Causal Encoder–Decoder: при prefill активируется около 8 млрд параметров на токен, а при decode — 16 млрд. То есть вычислительный бюджет для обработки входа и генерации намеренно сделали разным.В модели также используется новый Engram-модуль на 196 млрд параметров для работы с N-граммами. В сочетании с MoE это позволяет разделить часть знаний и вычислений между параметрами, которые не нужно прогонять через основную сеть на каждом токене.Отдельно DeepSeek переработала работу с KV-cache. Для длинного контекста это одна из ключевых оптимизаций V4.1-Flash: компания заявляет заметное снижение memory footprint по сравнению с предыдущим поколением. В документации модель также использует QAT для KV-cache и FP4-квантизацию, что дополнительно снижает требования к памяти при инференсе. Читать далее