Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

TerminalBench превратился в FrontierBench: 74 реалистичные задачи и битва GPT-5.6 Sol против Fable.

Популярный бенчмарк TerminalBench готовился к обновлению до третьей версии с начала весны, но вместо этого сменил название на FrontierBench. Первый выпуск включает 74 уникальные задачи ручной работы в самых разных доменах, не только в программировании.

На что способен FrontierBench

Создатели сделали акцент на реалистичность и экономическую ценность. Среди примеров:

  • ускорение медленного KV-cache-сервера (аналог справочника «имя ➡️ телефон») в 5 раз без остановки обслуживания, перенос на лету, при этом исходный код не даётся, а функционал нужно изучать самостоятельно;
  • расчёт резервного капитала банка под риски сделок с контрагентами с учётом залогов, валют и регуляторных правил, результат в CSV и Excel с формулами для аудита;
  • диспетчеризация доставки стройматериалов: новые заказы, отмены, изменение цен на топливо, учёт доступности машин и водителей, отдых, допуски к опасным грузам, окна доставки и прибыль; при этом часть решений уже зафиксирована и пересчёт «задним числом» невозможен.

Распределение задач по категориям авторы показали на иллюстрациях. На первой диаграмме видно качество текущих моделей: в лидерах GPT-5.6 Sol и Fable с результатом около трети решённых задач. Kimi K3 пока не тестировали.

Неожиданные расклады

Результаты удивили даже экспертов. Мы выделили ключевые моменты.

Во-первых, GPT-5.6 Sol не уступает Fable, хотя описание задач наводило на мысль, что более дорогая модель Anthropic окажется заметно лучше.

Во-вторых, Terra показывает уровень Opus 4.8 и практически не отстаёт от GPT-5.5 по многим бенчмаркам. OpenAI на релизе заявляли о «сопоставимости», и это подтвердилось.

В-третьих, Sonnet 5 снова разочаровывает. Она дороже Fable, проигрывает по точности и потребляет больше всех токенов: 18 млрд против 3,6 млрд у Fable 5 на весь бенчмарк. Похоже, Anthropic допустили просчёт в оптимизации.

В-четвёртых, Grok-4.5 подкупает немногословностью и экономичностью. Он чуть выгоднее Luna и вчетверо дешевле GLM-5.2 по затратам.

Стили работы агентов

Авторы обращают внимание на разные стратегии. Fable 5 (33,8%) и Opus 4.8 (21,1%) тратят больше токенов, но делают меньше действий. GPT-5.6 Sol (34,4%) и Terra (20,8%) действуют противоположно: меньше токенов, больше действий. В итоге GPT-5.6 Sol примерно на 40% дешевле и на 50% экономичнее по токенам, чем Fable 5.

Впереди выход GPT-6, и мы с интересом ждём новых результатов на этом многообещающем бенчмарке.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.