Сбер открыл исходный код GFusion: диффузионная LLM ускоряет генерацию до 70%.
Сбер открыл исходный код GFusion — экспериментальной диффузионной языковой модели, основанной на архитектуре GigaChat. Она работает иначе, чем классические авторегрессионные модели, которые генерируют текст последовательно токен за токеном. GFusion сначала создаёт приблизительный «набросок» ответа, а затем шаг за шагом дорабатывает его, подобно тому, как диффузионные нейросети генерируют изображения и видео.
Благодаря такому подходу модель оказалась до 70% быстрее GigaChat3-10B-A1.8B и на 39% быстрее версии с механизмом MTP. Качество при этом снизилось всего на 2–4 процентных пункта.
В открытый доступ выложены не только веса модели, но и код обучения, оптимизированные attention-ядра, а также интеграция с фреймворком SGLang. Любопытно, что весь проект реализовал стажёр команды GigaChat Pretrain, который после успешного завершения работы перешёл в штат.
Этот эксперимент показывает, что ускорения LLM можно добиваться не только за счёт увеличения вычислительных мощностей и дорогих GPU, но и за счёт изменения архитектуры генерации. Не столь важно, где запускается модель, сколь важно, как именно она формирует ответ.
Подробнее на Habr. Модель доступна на Hugging Face: GFusion-10B-A1.8B-base и GFusion-10B-A1.8B. Исходный код на GitVerse.

