Увеличение контекста без регистрации и СМС

Wait 5 sec.

В этой статье разберем, почему модель вообще не видит дальше обученного окна, как это чинится различными методами масштабирования (RoPE, NTK-aware, YaRN, LongRoPE/LongRoPE2) и как масштабирование влияет на скорость и точность генерации.В конце пройдемся по конкретным моделям от самых хайповых на текущих момент Qwen 3.8-27B и Qwen3.8-Flash-Next с их миллионом токенов до небольших Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B и посмотрим, что для них работает, а что нет. Читать далее