Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

GPT-6 Astra: первые итоги после релиза, игры, бенчмарки и будущая модель Bel.

Прошло почти три недели с релиза GPT-6 Astra, и уже можно подводить первые промежуточные итоги. Модель вышла сильной и способной: на многих бенчмарках она идёт вровень с Fable 5.1 или обходит её. Кроме того, текст Astra воспринимается заметно приятнее, чем формулировки Claude, и когнитивная нагрузка при чтении ниже.

Astra особенно выделяется в Computer Use и задачах с изображениями и видео. Пока неизвестно, что именно сделали OpenAI и связано ли это с Looped Transformers, но энтузиасты смогли заставить Astra пройти несколько игр: от простого задания «добудь алмаз в Minecraft» до легендарной ролевой игры Fallout 3, пространственной головоломки Portal и Factorio (основная игра и дополнение). Судя по всему, в большинстве случаев это не простой пайплайн «картинка с экрана -> действия»: где-то подключают MCP, где-то используются дополнительные механики, но результат всё равно впечатляет. Легко сказать, что модели обучались на всех видео из интернета и поэтому знают игры. Однако модели три-четыре месяца назад учились примерно на тех же данных, но не могли проходить игры от начала до конца.

Бенчмарки и первые оценки

Astra сильна не только в играх. На многих бенчмарках, включая те, что вышли после релиза или ещё не выпущены, но уже измерены, модель показывает существенный отрыв. Например, об этом сообщалось у Vals.AI. Отдельно выделяется WeirdML v3, свежий бенчмарк на ML-задачи: агенту дают данные и общее описание задачи, а его цель разобраться в данных, обучить модели и/или написать эвристики и прийти к решению. Автор пишет, что был очень удивлён оценке Astra и не ожидал, что ещё до фактического релиза бенчмарка лучшая оценка превысит 50%.

Весной после анонса Mythos/Fable существовал скепсис, что OpenAI сможет быстро догнать Anthropic. Компания долгое время не решалась на масштабирование моделей. Вероятно, не хотела упираться в нехватку вычислительных мощностей, с которой столкнулась сейчас. Опасения не подтвердились.

Теперь будет интересно наблюдать, как догоняют Google, Meta и xAI, а также китайские команды, развивающие open source. Тем временем в OpenAI, по слухам, уже идёт предтренировка ещё более крупной модели с кодовым названием Bel.

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.