Ant Group представила Ling-3.0-flash: MoE-модель для продакшн-агентов с гибридным ризонингом.
Ant Group официально анонсировала новую модель Ling-3.0-flash — это архитектура класса Mixture of Experts (MoE) с гибридным механизмом рассуждения, ориентированная на работу в составе продакшн-агентов. Общий объем модели достигает 124 миллиардов параметров, однако на каждый токен активируется лишь 5,1 миллиарда. Такой подход позволил добиться впечатляющих результатов: при одной восьмой общего размера и одной двенадцатой активных параметров Ling-3.0-flash догоняет или даже обходит их собственный флагман Ling-2.6-1T на большинстве заявленных бенчмарков.
Внутри используется нативное гибридно-линейное внимание, где слои KDA (Knowledge-Driven Attention) и MLA (Multi-Latent Attention) скомбинированы в пропорции 5:1. KDA обеспечивает тонкий контроль над долгосрочной памятью, а активация лишь 1/64 экспертов заметно удешевляет MoE-вычисления. При этом модель изначально поддерживает контекстное окно в 256 тысяч токенов, которое легко масштабируется до одного миллиона.
В официальном треде анонса разработчики показали семь демонстрационных агентских сценариев. Среди них: генерация города в Blender через MCP по одному промпту, слаженная работа команды из пяти исследовательских агентов, которая выдает готовую статью со слайдами, взаимодействие с Word и Excel без ручной доводки, верстка веб-страниц в разных дизайн-стилях и создание синтезатора с Web Audio прямо в браузере.
Веса модели пока не загрузили на Hugging Face, однако протестировать Ling-3.0-flash в деле можно уже сейчас. До 3 августа 2026 года она доступна для бесплатного использования на OpenRouter.

