Inception выпустила Mercury 2.5: диффузионная модель с контекстом 260K и скоростью 1107 токенов в секунду.
Inception выпустила Mercury 2.5 в релиз. Это диффузионная модель, которая пишет текст блоками параллельно. Производительность достигает 1107 токенов в секунду на обычных NVIDIA GPU. По данным Inception, это самая большая обученная диффузионная LLM.
Ключевые характеристики:
- плюс 40% к интеллекту Mercury 2;
- контекст 260K;
- уровень GPT-5.6 Luna на низком усилии и Haiku 4.5.
В анонсе появились кейсы клиентов, которые уже используют модель в продуктивной среде. Augment Code перевела на Mercury сжатие контекста, маршрутизацию и поиск MCP-инструментов: сжатие ускорилось со 150 секунд до 27 секунд, цена упала на 90%. У OpenCall с голосовыми агентами медиана ответа модели около 170 мс. Рядом представлены превью Mercury Voice с первым токеном быстрее 170 мс и Mercury Router, который читает запрос и распределяет его по сторонним моделям.
Цена составляет $0,20 за миллион входных и $0,75 за выходные токены. На старте действует скидка 80%: $0,04 и $0,15. Модель доступна в API Inception, на OpenRouter и Baseten. Новым аккаунтам предоставляют 100 млн токенов.
Следующая модель уже обучается, её обещают сделать крупнее и выпустить в ближайшие месяцы.
В ролике модель собирает веб-приложение по паре промптов.

