Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Zyphra открыла доступ к превью-модели ZAYA1-74B: что она умеет и чем отличается от ZAYA1-8B.

Компания Zyphra опубликовала превью более крупной модели ZAYA1-74B. Это промежуточный результат: модель прошла претрейн, мидтрейн и расширение контекста, однако RL-постобучение и инструктивный тюнинг на ней ещё не завершены.

ZAYA1-74B-Preview уже сравнивают с полноценными моделями по двум метрикам: avg@1 и pass@4. По pass@1 модель ожидаемо отстаёт, а вот показатели pass@4 приближаются к лидерам. В Zyphra считают, что такой разрыв говорит о большом скрытом потенциале базовой архитектуры, который финальный RL сможет раскрыть. Этот вывод подтверждается опытом работы над ZAYA1-8B, где между черновыми чекпоинтами с похожими значениями pass@k и готовой версией произошёл серьёзный прирост: +20.8 балла на AIME'26, +32.4 на HMMT'26, +10.0 на LiveCodeBench-v6, +11.7 на GPQA-Diamond и +19.0 на IFEval.

Внутренне 74B-модель построена на масштабированной архитектуре 8B. Здесь используется то же CCA-внимание, однако каждый второй слой заменён механизмом со скользящим окном размером 4K. По словам разработчиков, это почти вдвое сокращает размер KV-кеша без потерь на длинных последовательностях. Чтобы такой подход работал, при расширении контекста в слоях со скользящим окном сохранили исходное основание RoPE, а у глобальных слоёв его растянули. Сам контекст наращивали поэтапно: 32 тысячи токенов, затем 128 тысяч и, наконец, 256 тысяч.

Претрейн занял около 15 триллионов токенов в две основные фазы: сначала общие веб-данные, а затем усиленная математика, код и научные тексты. Ещё три фазы мидтрейна по одному триллиону токенов каждая отвечали за расширение контекста, введение reasoning-трасс и упор на агентные задачи.

Агентному режиму уделили особое внимание. На ZAYA1-8B он работал хуже, поэтому в обучающий корпус превью-версии 74B было добавлено значительно больше агентных материалов. Первые результаты на платформе τ-bench авторы называют многообещающими. При этом они делают оговорку, что pass@k слабо отражает реальное поведение в многошаговых сценариях, где критичны устойчивое следование инструкциям, удержание состояния и работа с промежуточными ошибками. Значительная часть этих качеств появляется как раз после агентного RL.

Старшую модель семейства также обучали исключительно на оборудовании AMD. Полноценный RL-этап уже идёт, и финальная версия ZAYA1-74B ожидается в ближайшие недели. Модель распространяется под лицензией Apache 2.0. Ознакомиться с ней можно в репозитории и в официальном блоге.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.