Zyphra открыла доступ к превью-модели ZAYA1-74B: что она умеет и чем отличается от ZAYA1-8B.
Компания Zyphra опубликовала превью более крупной модели ZAYA1-74B. Это промежуточный результат: модель прошла претрейн, мидтрейн и расширение контекста, однако RL-постобучение и инструктивный тюнинг на ней ещё не завершены.
ZAYA1-74B-Preview уже сравнивают с полноценными моделями по двум метрикам: avg@1 и pass@4. По pass@1 модель ожидаемо отстаёт, а вот показатели pass@4 приближаются к лидерам. В Zyphra считают, что такой разрыв говорит о большом скрытом потенциале базовой архитектуры, который финальный RL сможет раскрыть. Этот вывод подтверждается опытом работы над ZAYA1-8B, где между черновыми чекпоинтами с похожими значениями pass@k и готовой версией произошёл серьёзный прирост: +20.8 балла на AIME'26, +32.4 на HMMT'26, +10.0 на LiveCodeBench-v6, +11.7 на GPQA-Diamond и +19.0 на IFEval.
Внутренне 74B-модель построена на масштабированной архитектуре 8B. Здесь используется то же CCA-внимание, однако каждый второй слой заменён механизмом со скользящим окном размером 4K. По словам разработчиков, это почти вдвое сокращает размер KV-кеша без потерь на длинных последовательностях. Чтобы такой подход работал, при расширении контекста в слоях со скользящим окном сохранили исходное основание RoPE, а у глобальных слоёв его растянули. Сам контекст наращивали поэтапно: 32 тысячи токенов, затем 128 тысяч и, наконец, 256 тысяч.
Претрейн занял около 15 триллионов токенов в две основные фазы: сначала общие веб-данные, а затем усиленная математика, код и научные тексты. Ещё три фазы мидтрейна по одному триллиону токенов каждая отвечали за расширение контекста, введение reasoning-трасс и упор на агентные задачи.
Агентному режиму уделили особое внимание. На ZAYA1-8B он работал хуже, поэтому в обучающий корпус превью-версии 74B было добавлено значительно больше агентных материалов. Первые результаты на платформе τ-bench авторы называют многообещающими. При этом они делают оговорку, что pass@k слабо отражает реальное поведение в многошаговых сценариях, где критичны устойчивое следование инструкциям, удержание состояния и работа с промежуточными ошибками. Значительная часть этих качеств появляется как раз после агентного RL.
Старшую модель семейства также обучали исключительно на оборудовании AMD. Полноценный RL-этап уже идёт, и финальная версия ZAYA1-74B ожидается в ближайшие недели. Модель распространяется под лицензией Apache 2.0. Ознакомиться с ней можно в репозитории и в официальном блоге.

