Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Zyphra открыла доступ к превью-модели ZAYA1-74B: что она умеет и чем отличается от ZAYA1-8B.

Компания Zyphra опубликовала превью более крупной модели ZAYA1-74B. Это промежуточный результат: модель прошла претрейн, мидтрейн и расширение контекста, однако RL-постобучение и инструктивный тюнинг на ней ещё не завершены.

ZAYA1-74B-Preview уже сравнивают с полноценными моделями по двум метрикам: avg@1 и pass@4. По pass@1 модель ожидаемо отстаёт, а вот показатели pass@4 приближаются к лидерам. В Zyphra считают, что такой разрыв говорит о большом скрытом потенциале базовой архитектуры, который финальный RL сможет раскрыть. Этот вывод подтверждается опытом работы над ZAYA1-8B, где между черновыми чекпоинтами с похожими значениями pass@k и готовой версией произошёл серьёзный прирост: +20.8 балла на AIME'26, +32.4 на HMMT'26, +10.0 на LiveCodeBench-v6, +11.7 на GPQA-Diamond и +19.0 на IFEval.

Внутренне 74B-модель построена на масштабированной архитектуре 8B. Здесь используется то же CCA-внимание, однако каждый второй слой заменён механизмом со скользящим окном размером 4K. По словам разработчиков, это почти вдвое сокращает размер KV-кеша без потерь на длинных последовательностях. Чтобы такой подход работал, при расширении контекста в слоях со скользящим окном сохранили исходное основание RoPE, а у глобальных слоёв его растянули. Сам контекст наращивали поэтапно: 32 тысячи токенов, затем 128 тысяч и, наконец, 256 тысяч.

Претрейн занял около 15 триллионов токенов в две основные фазы: сначала общие веб-данные, а затем усиленная математика, код и научные тексты. Ещё три фазы мидтрейна по одному триллиону токенов каждая отвечали за расширение контекста, введение reasoning-трасс и упор на агентные задачи.

Агентному режиму уделили особое внимание. На ZAYA1-8B он работал хуже, поэтому в обучающий корпус превью-версии 74B было добавлено значительно больше агентных материалов. Первые результаты на платформе τ-bench авторы называют многообещающими. При этом они делают оговорку, что pass@k слабо отражает реальное поведение в многошаговых сценариях, где критичны устойчивое следование инструкциям, удержание состояния и работа с промежуточными ошибками. Значительная часть этих качеств появляется как раз после агентного RL.

Старшую модель семейства также обучали исключительно на оборудовании AMD. Полноценный RL-этап уже идёт, и финальная версия ZAYA1-74B ожидается в ближайшие недели. Модель распространяется под лицензией Apache 2.0. Ознакомиться с ней можно в репозитории и в официальном блоге.

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.