Ant Group представила Ling-2.6-flash: модель с 7,4 млрд активных параметров экономит токены и быстрее конкурентов.
Китайская компания Ant Group представила Ling-2.6-flash, которая затрагивает ключевую проблему всей индустрии LLM. Пока все соревнуются, чей ответ длиннее и красивее, Ant Group пошли в обратную сторону и выпустили Ling-2.6-flash.
Модель имеет 104 миллиарда параметров, из которых активных всего 7,4 миллиарда. Это MoE архитектура, где в каждый момент работает лишь малая часть сети, а вычисления обходятся с низкими затратами. Модель специально обучена не раздувать ответы. Никаких объёмных текстов на пустом месте, никакого повтора одной мысли на три абзаца ради видимости глубины.
Разработчики прямым текстом говорят: «мы оптимизировали соотношение интеллект на токен, а не интеллект на количество слов. Для тех, кто платит за API, это буквально экономия на ровном месте, потому что цена идёт за каждый токен, а результат тот же.»
Архитектура гибридная линейная, что даёт серьёзный прирост по скорости и памяти на длинных контекстах. Обычные трансформеры на длинном входе сталкиваются с квадратичной сложностью внимания, а тут эту проблему частично обошли. Модель быстрая, причём заметно.
Отдельно модель оптимизировали под агентские сценарии: вызов инструментов, многошаговое планирование, выполнение задач. Замеры идут на BFCL-V4, SWE-bench Verified, TAU2-bench и Claw-Eval — реальных агентных бенчмарках, а не на синтетике. И там Ling-2.6-flash держится на уровне конкурентов, которые имеют больше активных параметров.
Неделю даётся бесплатный доступ через OpenRouter и Novita, плюс официальная площадка ling.tbox.cn. Протестировать можно прямо сейчас, без оплаты и без ожидания вейтлиста. https://openrouter.ai/inclusionai/ling-2.6-flash:free

