Новый бенчмарк FrontierCode от Cognition: как AI-агенты сдают экзамен на мейнтейнера. Opus 4.8 xHigh впереди!
Команда Cognition, известная по проекту Devin, анонсировала бенчмарк FrontierCode. Мы внимательно изучили его особенности. Основной упор сделан на способность AI-агента создавать код, который мейнтейнер может принять мгновенно. Учитываются правила репозитория: тесты должны быть осмысленными и ломаться при ошибке, комментарии — в меру, а сам код — написан качественно.
В бенчмарке три набора: расширенный (150 задач), основной (100) и золотой (50). Каждую задачу прогоняли пять раз. Все они основаны на реальных проектах. Разработчики тратили более 40 часов на подготовку описания и проверок, чтобы исключить хаки.
Смотрим на лидеров: Opus 4.8 xHigh обходит всех с огромным отрывом. GPT-5.5-medium немного опережает Opus 4.7. Открытые модели и собственная разработка Cognition пока не дотягивают до топов. Остаётся только гадать, что показал бы Composer 2.5.
На сайте Cognition приведена детальная статистика по разным режимам рассуждения (цена, токены, шаги агента, время). Ознакомиться можно по ссылке.

