Бэкенд Transformers в vLLM больше не снижает скорость: прорыв в производительности!
Разработчики vLLM из Hugging Face совершили настоящий прорыв в производительности: бэкенд Transformers наконец догнал по скорости нативные реализации моделей. Мейнтейнер проекта продемонстрировал замеры, согласно которым после серии оптимизаций Qwen3-4B и Qwen3-32B показывают 100% пропускной способности от нативных реализаций, а MoE-модель Qwen3-235B и вовсе разогналась до 102%.
Главное преимущество этого технологического скачка заключается в том, что vLLM теперь способен запускать любую модель напрямую из кода библиотеки Transformers, даже если под неё нет отдельно оптимизированной реализации. Для этого достаточно всего лишь передать флаг --model-impl transformers. Раньше такой подход воспринимался как компромисс для работы с новыми или редкими архитектурами и приводил к потере нескольких процентов скорости. Теперь разницы больше нет: модель можно выкатывать в прод прямо в день её публикации на Hugging Face, не дожидаясь добавления нативной поддержки от разработчиков движка.
Все эти изменения войдут в грядущий релиз vLLM v0.25.0. Подробная инструкция по использованию бэкенда доступна в официальной документации.

