Artificial Analysis обновила ИИ-индекс до v4.3: Terminal-Bench 4.0 и AutomationBench.
Что изменилось
Мы посмотрели, как Artificial Analysis обновила свой индекс до v4.3. Terminal-Bench поднят с 2.1 до 4.0: агент теперь работает через mini-SWE-agent, задачи стали сложнее. Банковский бенчмарк τ³-Banking заменили на AutomationBench от Zapier: 657 рабочих сценариев в симуляциях Gmail, Slack, Salesforce и Jira с закрытым набором задач. Доля закрытых тестов в индексе выросла до 45%.
Лидеры рейтинга
Первое место делят Claude Fable 5.1 и GPT-6 Astra, следом идут Opus 5 и Fable 5. Среди открытых моделей лидируют GLM-5.3 и Kimi K3, третье место у GLM-5.3-Flash, далее Qwen3.8 и DeepSeek V4 Pro.
Цены за задачу
По цене за задачу большую часть фронта удерживает OpenAI: все пять уровней рассуждения Astra являются самыми дешёвыми на своём уровне. Из остальных моделей на переднем плане только Fable 5.1, GLM-5.3-Flash и MiMo-V2.5-Pro.

