Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

GPT-6 Astra не показала отрыва от Claude Fable 5 в бенчмарке Devin.

Самую объективную картину по GPT-6 Astra и её возможному переобучению под бенчмарки сейчас показывает бенчмарк агента разработки Devin.

По его результатам нельзя сказать, что GPT-6 Astra ушла в отрыв от Claude Fable 5. Это примерно одинаковые по уровню LLM, но GPT-6 Astra просто дешевле. Впрочем, похожая ситуация уже была: Kimi K3 и Qwen 3.8 Max тоже показывали результат, близкий к топовым версиям Claude, и предлагали цену ниже, чем у Anthropic. Однако Дарио Амодей не стал снижать цену, поскольку всегда подчёркивал: «Бенчмарки бенчмарками, но у меня LLM для реальной разработки».

Разница с GPT-6 Astra в том, что Сэм Альтман поставил целью номер один пройти бенчмарки для маркетинговой таблицы, но его быстро ловят либо на нереальном бенчмарке, как в ARC-AGI, либо просто на смене методики тестирования.

Сейчас моментом истины станет WebDev Arena. Если Альтман честен, то с его бенчмарками GPT-6 Astra должна показать отрыв от Claude Fable 5.1 минимум на 100 баллов Эло, а это уже другой класс в такой шкале. Примерно такой отрыв показывал Claude в действительно прорывных новых версиях. Если разрыв окажется меньше или GPT-6 Astra проиграет, то модель скорее запомнят как LLM с экстремальным обучением под бенчмарки.

Результаты бенчмарка: devin.ai/blog/gpt-6-astra

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.