Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Ant выкатила Ling-2.6-flash в open source: модель на 104B параметров с MoE-архитектурой выдает 215 токенов в секунду.

Компания Ant представила в открытом доступе модель Ling-2.6-flash, которая сразу привлекла внимание впечатляющими характеристиками.

Что под капотом

На бумаге это настоящий монстр со 104 миллиардами параметров, но одновременно в работе задействованы лишь 7,4 миллиарда. В основе лежит классическая MoE-архитектура, где сеть сама решает, каких «экспертов» подключать под конкретную задачу. Поэтому модель демонстрирует скорость, которую обычно не ожидаешь от столь крупных решений.

Скорость и экономия

Ling-2.6-flash разгоняется до 215 токенов в секунду на бенчмарке Artificial Analysis. Для сравнения, многие топовые модели показывают результат в районе 50–80 токенов в секунду, так что разрыв ощутимый. Еще интереснее другая цифра: на полном прогоне AA Intelligence Index модель потратила всего 15 миллионов токенов. В реальной эксплуатации такая экономия напрямую конвертируется в снижение затрат на инференс, ведь чем меньше токенов обработано, тем меньше итоговый счет.

Доступные конфигурации

Для деплоя разработчики предлагают три варианта весов: BF16 для тех, у кого аппаратных ресурсов с избытком, FP8 как разумный компромисс и INT4 для сильно ограниченных по памяти конфигураций. Таким образом, запустить модель можно как на мощном кластере, так и на одной видеокарте с квантизацией.

Модель доступна для скачивания на платформах:

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.