Инференс под нагрузкой: как обслуживать модель и честно считать её стоимость

Wait 5 sec.

Куда уходит память видеокарты при инференсе, что дают PagedAttention и непрерывное пакетирование и как посчитать стоимость задачи до запуска. Разбираем с цифрами.— Читать дальше «Инференс под нагрузкой: как обслуживать модель и честно считать её стоимость»