Компания Cursor выложила в опенсорс Mixture-of-Kittens (MoK) — "мегаядро" для обучения MoE-моделей на стойках Nvidia GB300 NVL72. Вся пересылка данных между 72 видеокартами и все вычисления MoE-слоя в нем выполняются одним гигантским GPU-ядром. По замерам самой компании, MoK работает до 2.37 раза быстрее лучших публичных решений, а в продакшене поднял сквозную скорость обучения на 41%: с 761 до 1070 токенов в секунду на видеокарту. На этом ядре Cursor уже обучает свою модель Composer на десятках тысяч GPU. Читать далее