Одна и та же модель ИИ показала результаты, отличающиеся почти вдвое, просто из-за смены оболочки.
Composio прогнала Kimi K3 через шесть агентных оболочек на одних и тех же 26 задачах. Модель везде одна, менялась только обвязка вокруг неё, и результаты разошлись сильно.
По решённым задачам впереди Kimi Code с 21 из 26, дальше Hermes Agent с 20, Pi Agent и Claude Code по 19, OpenCode 18, Codex 17. Codex сыпался на самых длинных сценариях: дважды упёрся в лимит 900 секунд на аудите расходов, который Pi Agent прошёл за 446.
По деньгам разброс больше. Средняя задача стоит 0,39 $ в Hermes Agent и 0,40 $ в Pi Agent против 1,47 $ в Claude Code. По медианному времени быстрее всех Pi Agent со 161,7 секунды, медленнее всех Claude Code с 347,6.
Одна модель, одни и те же задачи, а цена разъезжается в 3,8 раза и успех гуляет от 17 до 21 задачи из 26.
Вывод тут простой — подбирать важно не только модель под задачу, но и использовать подходящий харнес. Очень много потенциала заложено в этом подходе. Взять хотя бы посты Тибо о том, что, просто поменяв то, как модель работает, команда OpenAI смогла добиться SOTA на ARC-AGI-3.

