LLMCOD перешёл на Qwen 3.8: 2× параллельность, 32K контекст и MTP-ускорение на V100

Wait 5 sec.

До обновления API LLMCOD работал на Qwen 3.6. Модель справлялась, но по мере роста числа клиентов и усложнения промптов (длинные базы знаний, многошаговые диалоги, агенты) стало понятно: нужен более свежий бэкенд с лучшим качеством推理 и более эффективным использованием GPU.Цель — получить максимум от имеющегося железа (Tesla V100-SXM2-32GB), не покупая новый GPU. Читать далее