TerminalBench превратился в FrontierBench: 74 реалистичные задачи и битва GPT-5.6 Sol против Fable.
Популярный бенчмарк TerminalBench готовился к обновлению до третьей версии с начала весны, но вместо этого сменил название на FrontierBench. Первый выпуск включает 74 уникальные задачи ручной работы в самых разных доменах, не только в программировании.
На что способен FrontierBench
Создатели сделали акцент на реалистичность и экономическую ценность. Среди примеров:
- ускорение медленного KV-cache-сервера (аналог справочника «имя ➡️ телефон») в 5 раз без остановки обслуживания, перенос на лету, при этом исходный код не даётся, а функционал нужно изучать самостоятельно;
- расчёт резервного капитала банка под риски сделок с контрагентами с учётом залогов, валют и регуляторных правил, результат в CSV и Excel с формулами для аудита;
- диспетчеризация доставки стройматериалов: новые заказы, отмены, изменение цен на топливо, учёт доступности машин и водителей, отдых, допуски к опасным грузам, окна доставки и прибыль; при этом часть решений уже зафиксирована и пересчёт «задним числом» невозможен.
Распределение задач по категориям авторы показали на иллюстрациях. На первой диаграмме видно качество текущих моделей: в лидерах GPT-5.6 Sol и Fable с результатом около трети решённых задач. Kimi K3 пока не тестировали.
Неожиданные расклады
Результаты удивили даже экспертов. Мы выделили ключевые моменты.
Во-первых, GPT-5.6 Sol не уступает Fable, хотя описание задач наводило на мысль, что более дорогая модель Anthropic окажется заметно лучше.
Во-вторых, Terra показывает уровень Opus 4.8 и практически не отстаёт от GPT-5.5 по многим бенчмаркам. OpenAI на релизе заявляли о «сопоставимости», и это подтвердилось.
В-третьих, Sonnet 5 снова разочаровывает. Она дороже Fable, проигрывает по точности и потребляет больше всех токенов: 18 млрд против 3,6 млрд у Fable 5 на весь бенчмарк. Похоже, Anthropic допустили просчёт в оптимизации.
В-четвёртых, Grok-4.5 подкупает немногословностью и экономичностью. Он чуть выгоднее Luna и вчетверо дешевле GLM-5.2 по затратам.
Стили работы агентов
Авторы обращают внимание на разные стратегии. Fable 5 (33,8%) и Opus 4.8 (21,1%) тратят больше токенов, но делают меньше действий. GPT-5.6 Sol (34,4%) и Terra (20,8%) действуют противоположно: меньше токенов, больше действий. В итоге GPT-5.6 Sol примерно на 40% дешевле и на 50% экономичнее по токенам, чем Fable 5.
Впереди выход GPT-6, и мы с интересом ждём новых результатов на этом многообещающем бенчмарке.

