Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

vLLM протестировал DSpark на DeepSeek-V4-Pro: ускорение до 42% против MTP на 8 GPU B300.

Популярный фреймворк для инференса vLLM официально добавил поддержку DeepSeek-V4-Pro-DSpark. Это новая модель DeepSeek с технологией мультитокенового предсказания DSpark, которая ускоряет генерацию.

Для тестов инженеры использовали восемь ускорителей NVIDIA B300 общей стоимостью около $500 000. При одном конкурентном запросе и среднем количестве предсказанных токенов около 5 штук им удалось достичь скорости примерно 250 токенов/с. По результатам замеров DSpark обеспечивает прирост производительности на 12–42% по сравнению с MTP — в зависимости от длины драфта и текущей загрузки оборудования.

Это скромнее цифр самой DeepSeek (50–80% в их тестах), но объясняется принципом работы DSpark. В нём реализован Hardware-Aware Scheduler, который динамически выделяет вычислительные ресурсы под предсказание токенов, ориентируясь на загрузку GPU. В установках за полмиллиона долларов ядра чипов могут быть загружены под 90%, а на крупных суперкластерах для LLM главным тормозом становится передача данных между GPU — из-за этого ядра часто загружены лишь на 60%. DSpark как раз нацеливается на свободные 40%.

Таким образом, при локальном запуске технология даёт умеренный, но вполне ощутимый выигрыш. А вот через API модель DeepSeek показывает по-настоящему впечатляющую прыть. Даже актуальный DeepSeek V4 Flash разгоняется выше 100 токенов/с, что в 2–3 раза быстрее среднего инференса решений от Anthropic и OpenAI в OpenRouter.

Попробовать DSpark можно с помощью ночной сборки vLLM nightly. Запустите сервер следующей командой:

vllm serve deepseek-ai/DeepSeek-V4-Pro-DSpark -tp 8 --trust-remote-code --kv-cache-dtype fp8 --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.