Нейронные сети нетрадиционного ускорения

Wait 5 sec.

В последнее время все помешались на ускорении генерации токенов локальных моделей. В погоне за скоростью люди бездумно квантуют KV-кэш до предела, обрезают контекст до уровня памяти рыбки-гуппи, а затем идут в комментарии жаловаться, что модель вдруг отупела и забывает половину диалога. Такой подход похож на быстрый бег по тёмной улице без уличного освещения. Можно бежать реально быстро, но только до первого столба.Пора это исправлять. Данная статья знакомит читателя с современными методами спекулятивного декодирования, ускоряющими скорость генерации без всякой лоботомии. Читать далее