Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

NVIDIA представила Nemotron 3.5 Lightning: 30B параметров, но активны только 3B на токен!

Основные характеристики

NVIDIA представила модель Nemotron 3.5 Lightning: в ней 30B параметров, но на каждый токен работают только 3B.

Модель сделана под долгоживущих AI-агентов, coding-задачи и дешёвый инференс. Внутри гибридная архитектура Mamba-2 + MoE + Attention, контекст до 1 млн токенов, а pretraining прошёл на более чем 20 трлн токенов.

За счёт MoE из 30B параметров активируются около 3B, поэтому модель можно развернуть даже на одном H100 или DGX Spark. NVIDIA сразу выпустила и NVFP4 checkpoint для более экономного инференса.

Скорость и результаты

Отдельно прокачали скорость генерации. Вместе с Lightning выходят сразу три варианта speculative decoding: встроенный MTP и внешние drafter-модели DSpark и DFlash, которые пытаются предсказывать несколько следующих токенов за один проход.

По собственным eval NVIDIA, NVFP4-версия набирает 75,57 на GPQA Diamond, 52,8 на SWE-bench Verified и 81,62 на MMLU Pro. При этом модель специально готовили через SFT и RL для кода, tool calling, многошаговых агентных задач и structured output.

Мы считаем, что получился довольно интересный рабочий двигатель для агентов: огромный контекст, всего 3B активных параметров и несколько способов разогнать decode без перехода к гигантской модели.

huggingface.co/collections/nvidia/nvidia-nemotron-v3

Этот пост Вконтакте:

Ещё новости:

Демис Хассабис отходит от управления Google DeepMind ради AGI и здоровья.
Microsoft раскрыла неудобную правду: почти весь её ИИ-бизнес держится на OpenAI.
По данным FT, ByteDance обучает модель до 10 триллионов параметров.
What Runtime от Bad Theory Labs обещает 10 млн бесплатных токенов и доступ к 340+ моделям.
В GTA появились живые ИИ-персонажи: они спорят, запоминают и обсуждают игроков.
NVIDIA готова вложить до $3 млрд в Lancium: ставка на электричество для Stargate.
Claude Code получил постоянную память между сессиями через Claude-Mem.
Claude не доказал гипотезу Римана, но поднял нижнюю границу нулей дзета-функции с 41,6% до 67,2%.
Alibaba Cloud теперь строит крупные AI-дата-центры всего за 100 дней.
Kimi-K3 поймали на следах Claude: модель могла обучаться на скрытых рассуждениях.