Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Artificial Analysis обновила ИИ-индекс до v4.3: Terminal-Bench 4.0 и AutomationBench.

Что изменилось

Мы посмотрели, как Artificial Analysis обновила свой индекс до v4.3. Terminal-Bench поднят с 2.1 до 4.0: агент теперь работает через mini-SWE-agent, задачи стали сложнее. Банковский бенчмарк τ³-Banking заменили на AutomationBench от Zapier: 657 рабочих сценариев в симуляциях Gmail, Slack, Salesforce и Jira с закрытым набором задач. Доля закрытых тестов в индексе выросла до 45%.

Лидеры рейтинга

Первое место делят Claude Fable 5.1 и GPT-6 Astra, следом идут Opus 5 и Fable 5. Среди открытых моделей лидируют GLM-5.3 и Kimi K3, третье место у GLM-5.3-Flash, далее Qwen3.8 и DeepSeek V4 Pro.

Цены за задачу

По цене за задачу большую часть фронта удерживает OpenAI: все пять уровней рассуждения Astra являются самыми дешёвыми на своём уровне. Из остальных моделей на переднем плане только Fable 5.1, GLM-5.3-Flash и MiMo-V2.5-Pro.

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.