vLLM протестировал DSpark на DeepSeek-V4-Pro: ускорение до 42% против MTP на 8 GPU B300.
Популярный фреймворк для инференса vLLM официально добавил поддержку DeepSeek-V4-Pro-DSpark. Это новая модель DeepSeek с технологией мультитокенового предсказания DSpark, которая ускоряет генерацию.
Для тестов инженеры использовали восемь ускорителей NVIDIA B300 общей стоимостью около $500 000. При одном конкурентном запросе и среднем количестве предсказанных токенов около 5 штук им удалось достичь скорости примерно 250 токенов/с. По результатам замеров DSpark обеспечивает прирост производительности на 12–42% по сравнению с MTP — в зависимости от длины драфта и текущей загрузки оборудования.
Это скромнее цифр самой DeepSeek (50–80% в их тестах), но объясняется принципом работы DSpark. В нём реализован Hardware-Aware Scheduler, который динамически выделяет вычислительные ресурсы под предсказание токенов, ориентируясь на загрузку GPU. В установках за полмиллиона долларов ядра чипов могут быть загружены под 90%, а на крупных суперкластерах для LLM главным тормозом становится передача данных между GPU — из-за этого ядра часто загружены лишь на 60%. DSpark как раз нацеливается на свободные 40%.
Таким образом, при локальном запуске технология даёт умеренный, но вполне ощутимый выигрыш. А вот через API модель DeepSeek показывает по-настоящему впечатляющую прыть. Даже актуальный DeepSeek V4 Flash разгоняется выше 100 токенов/с, что в 2–3 раза быстрее среднего инференса решений от Anthropic и OpenAI в OpenRouter.
Попробовать DSpark можно с помощью ночной сборки vLLM nightly. Запустите сервер следующей командой:
vllm serve deepseek-ai/DeepSeek-V4-Pro-DSpark -tp 8 --trust-remote-code --kv-cache-dtype fp8 --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

