Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

vLLM протестировал DSpark на DeepSeek-V4-Pro: ускорение до 42% против MTP на 8 GPU B300.

Популярный фреймворк для инференса vLLM официально добавил поддержку DeepSeek-V4-Pro-DSpark. Это новая модель DeepSeek с технологией мультитокенового предсказания DSpark, которая ускоряет генерацию.

Для тестов инженеры использовали восемь ускорителей NVIDIA B300 общей стоимостью около $500 000. При одном конкурентном запросе и среднем количестве предсказанных токенов около 5 штук им удалось достичь скорости примерно 250 токенов/с. По результатам замеров DSpark обеспечивает прирост производительности на 12–42% по сравнению с MTP — в зависимости от длины драфта и текущей загрузки оборудования.

Это скромнее цифр самой DeepSeek (50–80% в их тестах), но объясняется принципом работы DSpark. В нём реализован Hardware-Aware Scheduler, который динамически выделяет вычислительные ресурсы под предсказание токенов, ориентируясь на загрузку GPU. В установках за полмиллиона долларов ядра чипов могут быть загружены под 90%, а на крупных суперкластерах для LLM главным тормозом становится передача данных между GPU — из-за этого ядра часто загружены лишь на 60%. DSpark как раз нацеливается на свободные 40%.

Таким образом, при локальном запуске технология даёт умеренный, но вполне ощутимый выигрыш. А вот через API модель DeepSeek показывает по-настоящему впечатляющую прыть. Даже актуальный DeepSeek V4 Flash разгоняется выше 100 токенов/с, что в 2–3 раза быстрее среднего инференса решений от Anthropic и OpenAI в OpenRouter.

Попробовать DSpark можно с помощью ночной сборки vLLM nightly. Запустите сервер следующей командой:

vllm serve deepseek-ai/DeepSeek-V4-Pro-DSpark -tp 8 --trust-remote-code --kv-cache-dtype fp8 --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.