Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Qwen3.8-27B теперь работает со скоростью 70 токенов/с на ноутбуке. Вышел DFlash 2.

Модель Qwen3.8-27B теперь работает со скоростью 70 токенов в секунду прямо на ноутбуке. Вышел DFlash 2. Это новое поколение спекулятивного декодирования на основе блочной диффузии.

DFlash 2 разгоняет Qwen3.8-27B до 70 токенов в секунду на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели: буквально ни одного отличающегося токена.

Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.

Суть подхода описана в блоге: https://inco.ai/blog/dflash2/.

Этот пост Вконтакте:

Ещё новости:

Claude Code получил новый стиль ответов Concise.
Qwen выпустила AVA-Encoder: видео превращается в редактируемый граф знаний.
Европейский центробанк предупреждает: пузырь ИИ скоро лопнет.
ИИ поможет спасти китов от столкновений с судами.
10 миллионов токенов даром: почему это развод.
Рост ИИ поднимает цены на стойки в ЦОД Москвы и Петербурга.
Open Bot: опенсорсная версия Grok Bot для рабочих задач!
Как прокачать GigaChat: внешняя база знаний, Qwen, DeepSeek и Structured Output.
MiniMax-Music3 Portable by Neurogen: портативное приложение для генерации музыки.
Grok лидирует в MedAgentBench, а MAST выводит вперёд GPT-5.6 Sol и Kimi K3: почему одной LLM мало.