Uno от IFM и Cerebras ускоряет языковые модели до трех раз без потери качества!
Мы изучили проект Uno (IFM + Cerebras). Это способ ускорить большую языковую модель без потери качества.
Обычные модели пишут текст по одному слову за раз. Uno учит модель предсказывать целыми блоками параллельно, как будто она печатает сразу по несколько слов, а не по одному.
У модели два набора «мозгов»: один отвечает за качество и делает все как раньше, второй легкий и быстрый, догадывается, какие слова идут подряд. Вместе они выдают ровно тот же результат, что и оригинал, но в разы быстрее.
Существующие ускорители DFlash и Eagle3 требуют вторую отдельную черновую модель, а это лишняя память и сложность. Uno обходится без нее: все встроено в одну модель. Меньше веса, меньше памяти, проще запускать.
В результате модель работает до 3 раз быстрее базовой версии. При этом модель на 8B параметров обходит по качеству диффузионного гиганта на 26B и проприетарный Mercury 2.
Проект доступен на GitHub и Hugging Face.

