[Перевод] Почему MoE-модель тормозит? Чек-лист из трех шагов

Wait 5 sec.

Вы запускаете большую MoE‑модель (например, Qwen, DeepSeek, Mixtral) на локальной машине через llama.cpp / llama-server, но скорость генерации токенов в разы ниже ожидаемой. Статья — для Linux-пользователей с гибридными процессорами Intel 12-го поколения и новее и видеокартами NVIDIA (CUDA). Конфигурация: RTX 4070 (12 ГБ), i5-12600K, 32 ГБ DDR5-6000.Статья написана по мотивам публикации "Local LLM Inference Optimization: The Complete Guide" и является частью цикла статьей по траблшутингу и оптимизации работы языковой модели на локальных машинах. Открыть чек-лист