GPT-6 Astra не показала отрыва от Claude Fable 5 в бенчмарке Devin.
Самую объективную картину по GPT-6 Astra и её возможному переобучению под бенчмарки сейчас показывает бенчмарк агента разработки Devin.
По его результатам нельзя сказать, что GPT-6 Astra ушла в отрыв от Claude Fable 5. Это примерно одинаковые по уровню LLM, но GPT-6 Astra просто дешевле. Впрочем, похожая ситуация уже была: Kimi K3 и Qwen 3.8 Max тоже показывали результат, близкий к топовым версиям Claude, и предлагали цену ниже, чем у Anthropic. Однако Дарио Амодей не стал снижать цену, поскольку всегда подчёркивал: «Бенчмарки бенчмарками, но у меня LLM для реальной разработки».
Разница с GPT-6 Astra в том, что Сэм Альтман поставил целью номер один пройти бенчмарки для маркетинговой таблицы, но его быстро ловят либо на нереальном бенчмарке, как в ARC-AGI, либо просто на смене методики тестирования.
Сейчас моментом истины станет WebDev Arena. Если Альтман честен, то с его бенчмарками GPT-6 Astra должна показать отрыв от Claude Fable 5.1 минимум на 100 баллов Эло, а это уже другой класс в такой шкале. Примерно такой отрыв показывал Claude в действительно прорывных новых версиях. Если разрыв окажется меньше или GPT-6 Astra проиграет, то модель скорее запомнят как LLM с экстремальным обучением под бенчмарки.
Результаты бенчмарка: devin.ai/blog/gpt-6-astra

