Букмарклет вычисляющий скорость gguf модели в llama.cpp на hf

Wait 5 sec.

С приходом нейросетей теперь можно решать задачи гораздо проще, правда и задачи бы такой не стояло не будь нейросетей и llama.cpp, и huggingface. В общем смысл статьи в том чтобы попытаться математически вычислить теоретическую скорость генерации токенов в программе llama.cpp для моделей на hugginface, просто открыв карточку модели и нажав на закладку (букмарклет). Вот как это выглядит:На самом деле этих калькуляторов полно и много, но почему-то у меня они показывают совсем не то что я вижу в реальности. Опять же, для меня было открытие что я могу на своей RTX3070 8Gb запускать MOE модели до 35 млрд параметров на довольно неплохой скорости, просто потому что нейронки в чатах говорят что все - конец - этого не хватит. Я думаю что они остановились в своем развитии где-то год назад и все еще частенько вспоминают про модели llama или mistral но сейчас то уже не совсем актуально, по крайней мере для использования, может для научных изысканий и нет лучше, не знаю. В общем-то и в этом калькуляторе нет никаких новых идей - просто я прогнал на своем компе несколько моделей, замерил скорость,замерил +- максимально возможный контекст, при котором llama.cpp не вылетает по нехватке памяти и попросил нейронку сделать калькулятор, чтобы он показывал цифры близкие мне, потому что расчетные цифры по контексту нейронка занижала в разы. Мне просто стало интересно почему так - она говорит что максимальный контекст 20 тысяч условно, а смог выжать 70 тысяч - разница в разы. Читать далее