Куда уходит память видеокарты при инференсе, что дают PagedAttention и непрерывное пакетирование и как посчитать стоимость задачи до запуска. Разбираем с цифрами.— Читать дальше «Инференс под нагрузкой: как обслуживать модель и честно считать её стоимость»