Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

TerminalBench превратился в FrontierBench: 74 реалистичные задачи и битва GPT-5.6 Sol против Fable.

Популярный бенчмарк TerminalBench готовился к обновлению до третьей версии с начала весны, но вместо этого сменил название на FrontierBench. Первый выпуск включает 74 уникальные задачи ручной работы в самых разных доменах, не только в программировании.

На что способен FrontierBench

Создатели сделали акцент на реалистичность и экономическую ценность. Среди примеров:

  • ускорение медленного KV-cache-сервера (аналог справочника «имя ➡️ телефон») в 5 раз без остановки обслуживания, перенос на лету, при этом исходный код не даётся, а функционал нужно изучать самостоятельно;
  • расчёт резервного капитала банка под риски сделок с контрагентами с учётом залогов, валют и регуляторных правил, результат в CSV и Excel с формулами для аудита;
  • диспетчеризация доставки стройматериалов: новые заказы, отмены, изменение цен на топливо, учёт доступности машин и водителей, отдых, допуски к опасным грузам, окна доставки и прибыль; при этом часть решений уже зафиксирована и пересчёт «задним числом» невозможен.

Распределение задач по категориям авторы показали на иллюстрациях. На первой диаграмме видно качество текущих моделей: в лидерах GPT-5.6 Sol и Fable с результатом около трети решённых задач. Kimi K3 пока не тестировали.

Неожиданные расклады

Результаты удивили даже экспертов. Мы выделили ключевые моменты.

Во-первых, GPT-5.6 Sol не уступает Fable, хотя описание задач наводило на мысль, что более дорогая модель Anthropic окажется заметно лучше.

Во-вторых, Terra показывает уровень Opus 4.8 и практически не отстаёт от GPT-5.5 по многим бенчмаркам. OpenAI на релизе заявляли о «сопоставимости», и это подтвердилось.

В-третьих, Sonnet 5 снова разочаровывает. Она дороже Fable, проигрывает по точности и потребляет больше всех токенов: 18 млрд против 3,6 млрд у Fable 5 на весь бенчмарк. Похоже, Anthropic допустили просчёт в оптимизации.

В-четвёртых, Grok-4.5 подкупает немногословностью и экономичностью. Он чуть выгоднее Luna и вчетверо дешевле GLM-5.2 по затратам.

Стили работы агентов

Авторы обращают внимание на разные стратегии. Fable 5 (33,8%) и Opus 4.8 (21,1%) тратят больше токенов, но делают меньше действий. GPT-5.6 Sol (34,4%) и Terra (20,8%) действуют противоположно: меньше токенов, больше действий. В итоге GPT-5.6 Sol примерно на 40% дешевле и на 50% экономичнее по токенам, чем Fable 5.

Впереди выход GPT-6, и мы с интересом ждём новых результатов на этом многообещающем бенчмарке.

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.