GPT-6 Astra: шесть агентских оболочек сравнили по цене и результату.
Composio протестировала GPT-6 Astra в шести агентских оболочках, которые управляют вызовами инструментов и работой модели. На 29 задачах результаты оказались близкими, но затраты разошлись заметно. По оценке авторов эксперимента, стоимость успешной задачи различалась почти в 2,5 раза.
В тесте использовались задачи для работы с сервисами: почтой, таблицами, календарями и другими приложениями. В методике Composio результат проверяется по состоянию данных и ответу агента, для зачёта должны пройти все проверки.
Результаты
- Codex, Hermes Agent и Command Code решили 21 из 29 задач, или 72,4%
- Claude Code решил 20 из 29 задач, или 69%
- OpenCode и Pi Agent решили 19 из 29 задач, или 65,5%
Эти результаты подтверждает публичная таблица Composio. Между крайними значениями всего две задачи. По данным обсуждения, 18 задач решили все шесть оболочек, восемь провалили все. Разногласия возникли лишь на трёх.
Самым неприятным стал расход на неудачные попытки. Авторы сообщают, что провальные запуски потребляли от 3 до 5 раз больше токенов, чем успешные. OpenCode в это сравнение не вошёл, так как данных о расходе токенов Astra у него не было. Задача не решена, но счёт выставлен.
Claude Code показал наибольшую медиану числа вызовов инструментов и на задачах, которые прошли все, и на тех, которые все провалили. У OpenCode вызовов было меньше всего. Повышенная активность сама по себе ещё не означает лучший результат.
Деньги и время
- Оценочная стоимость успешной задачи: $1,06 у Pi Agent против $2,62 у Claude Code
- Медианное время задачи: у Pi Agent 99 секунд, у Codex 100, у Hermes Agent 102, у Claude Code 201

