Ant выкатила Ling-2.6-flash в open source: модель на 104B параметров с MoE-архитектурой выдает 215 токенов в секунду.
Компания Ant представила в открытом доступе модель Ling-2.6-flash, которая сразу привлекла внимание впечатляющими характеристиками.
Что под капотом
На бумаге это настоящий монстр со 104 миллиардами параметров, но одновременно в работе задействованы лишь 7,4 миллиарда. В основе лежит классическая MoE-архитектура, где сеть сама решает, каких «экспертов» подключать под конкретную задачу. Поэтому модель демонстрирует скорость, которую обычно не ожидаешь от столь крупных решений.
Скорость и экономия
Ling-2.6-flash разгоняется до 215 токенов в секунду на бенчмарке Artificial Analysis. Для сравнения, многие топовые модели показывают результат в районе 50–80 токенов в секунду, так что разрыв ощутимый. Еще интереснее другая цифра: на полном прогоне AA Intelligence Index модель потратила всего 15 миллионов токенов. В реальной эксплуатации такая экономия напрямую конвертируется в снижение затрат на инференс, ведь чем меньше токенов обработано, тем меньше итоговый счет.
Доступные конфигурации
Для деплоя разработчики предлагают три варианта весов: BF16 для тех, у кого аппаратных ресурсов с избытком, FP8 как разумный компромисс и INT4 для сильно ограниченных по памяти конфигураций. Таким образом, запустить модель можно как на мощном кластере, так и на одной видеокарте с квантизацией.
Модель доступна для скачивания на платформах:

