Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

GPT-6 Astra: шесть агентских оболочек сравнили по цене и результату.

Composio протестировала GPT-6 Astra в шести агентских оболочках, которые управляют вызовами инструментов и работой модели. На 29 задачах результаты оказались близкими, но затраты разошлись заметно. По оценке авторов эксперимента, стоимость успешной задачи различалась почти в 2,5 раза.

В тесте использовались задачи для работы с сервисами: почтой, таблицами, календарями и другими приложениями. В методике Composio результат проверяется по состоянию данных и ответу агента, для зачёта должны пройти все проверки.

Результаты

  • Codex, Hermes Agent и Command Code решили 21 из 29 задач, или 72,4%
  • Claude Code решил 20 из 29 задач, или 69%
  • OpenCode и Pi Agent решили 19 из 29 задач, или 65,5%

Эти результаты подтверждает публичная таблица Composio. Между крайними значениями всего две задачи. По данным обсуждения, 18 задач решили все шесть оболочек, восемь провалили все. Разногласия возникли лишь на трёх.

Самым неприятным стал расход на неудачные попытки. Авторы сообщают, что провальные запуски потребляли от 3 до 5 раз больше токенов, чем успешные. OpenCode в это сравнение не вошёл, так как данных о расходе токенов Astra у него не было. Задача не решена, но счёт выставлен.

Claude Code показал наибольшую медиану числа вызовов инструментов и на задачах, которые прошли все, и на тех, которые все провалили. У OpenCode вызовов было меньше всего. Повышенная активность сама по себе ещё не означает лучший результат.

Деньги и время

  • Оценочная стоимость успешной задачи: $1,06 у Pi Agent против $2,62 у Claude Code
  • Медианное время задачи: у Pi Agent 99 секунд, у Codex 100, у Hermes Agent 102, у Claude Code 201
Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.