Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Alibaba показала тесты Qwen3.8-Max: модель класса Claude Opus с аналитикой доктора наук и автономной разработкой.

Alibaba опубликовала официальные результаты тестов своей новой флагманской модели Qwen3.8-Max. По совокупности характеристик она соответствует классу Claude Opus, однако компания не стала демпинговать по ценам.

Научный анализ на уровне доктора наук

Мы протестировали Qwen3.8-Max в научных исследованиях, и она показала впечатляющие способности в работе со сложным математическим аппаратом. Если дать модели достаточно времени на обдумывание с помощью длинного CoT, её компетенции сравнимы скорее с доктором наук, чем с кандидатом. Это подтверждается лидерством в бенчмарке PaperBench. Иногда наблюдается перекос в сторону излишне критической точки зрения, но глубина научно-технического разбора заметно превосходит Claude, Gemini и DeepSeek. Для агентов с научным блоком Qwen3.8-Max выглядит как очень хорошее решение.

Автономная разработка растягивается на 10+ дней

В сегменте разработки мы обращаем внимание не столько на SWE Bench (все фронтирные модели уже хорошо исправляют баги), сколько на более сложный Terminal Bench, где код для агента является «чёрным ящиком». По заявлениям Alibaba, Qwen3.8-Max достигает уровня автономной разработки на протяжении 10+ дней. Это часть тренда: траектории разработки быстро удлиняются, и ключевой проблемой становится корректная постановка задачи, так как исправления по ходу работы уже не вносятся. Такой подход можно назвать AI Waterfall 2.0: вместо Agile требуется загружать в «фабрику производства кода» предельно чёткие спецификации. Мастерство управления агентами смещается в создание детализированных спеков и прототипов, наглядно демонстрирующих требуемый результат.

Нативное мультимодальное обучение

Qwen3.8-Max, как и Kimi K3, обучалась мультимодально с самого начала – на смеси текстов и графиков ещё на этапе pretraining. Alibaba публикует множество бенчмарков по направлению Vision с передовыми результатами. Особо выделяется CharXiv, где модель должна читать сложные диаграммы и схемы уровня научных исследований, а не простые графики.

Open-weights и цены

Модели Qwen3.8-Max и Qwen3.8-27B будут выпущены как open-weights. 27-миллиардная версия заслуживает отдельного внимания, ведь даже предыдущая генерация на стеке Python и React демонстрировала способность программировать на уровне LLM. Для тех, кто работает в закрытом контуре, это важная опора: на ней как минимум можно писать тесты.

Стоимость токенов: ввод — $2.0 за миллион токенов, вывод — $6.0, кэширование — $0.25. Судя по ценам, Alibaba уверена в качестве Qwen3.8-Max.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.