GPT-6 Astra: первые итоги после релиза, игры, бенчмарки и будущая модель Bel.
Прошло почти три недели с релиза GPT-6 Astra, и уже можно подводить первые промежуточные итоги. Модель вышла сильной и способной: на многих бенчмарках она идёт вровень с Fable 5.1 или обходит её. Кроме того, текст Astra воспринимается заметно приятнее, чем формулировки Claude, и когнитивная нагрузка при чтении ниже.
Astra особенно выделяется в Computer Use и задачах с изображениями и видео. Пока неизвестно, что именно сделали OpenAI и связано ли это с Looped Transformers, но энтузиасты смогли заставить Astra пройти несколько игр: от простого задания «добудь алмаз в Minecraft» до легендарной ролевой игры Fallout 3, пространственной головоломки Portal и Factorio (основная игра и дополнение). Судя по всему, в большинстве случаев это не простой пайплайн «картинка с экрана -> действия»: где-то подключают MCP, где-то используются дополнительные механики, но результат всё равно впечатляет. Легко сказать, что модели обучались на всех видео из интернета и поэтому знают игры. Однако модели три-четыре месяца назад учились примерно на тех же данных, но не могли проходить игры от начала до конца.
Бенчмарки и первые оценки
Astra сильна не только в играх. На многих бенчмарках, включая те, что вышли после релиза или ещё не выпущены, но уже измерены, модель показывает существенный отрыв. Например, об этом сообщалось у Vals.AI. Отдельно выделяется WeirdML v3, свежий бенчмарк на ML-задачи: агенту дают данные и общее описание задачи, а его цель разобраться в данных, обучить модели и/или написать эвристики и прийти к решению. Автор пишет, что был очень удивлён оценке Astra и не ожидал, что ещё до фактического релиза бенчмарка лучшая оценка превысит 50%.
Весной после анонса Mythos/Fable существовал скепсис, что OpenAI сможет быстро догнать Anthropic. Компания долгое время не решалась на масштабирование моделей. Вероятно, не хотела упираться в нехватку вычислительных мощностей, с которой столкнулась сейчас. Опасения не подтвердились.
Теперь будет интересно наблюдать, как догоняют Google, Meta и xAI, а также китайские команды, развивающие open source. Тем временем в OpenAI, по слухам, уже идёт предтренировка ещё более крупной модели с кодовым названием Bel.

