Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Яндекс открыл код Alice AI-T5-35B-A0.6B: модель быстрых ответов для Поиска.

На этой неделе Яндекс открыл код модели Alice AI-T5-35B-A0.6B. Это обученная с нуля претрейн-модель, которая отвечает за быстрые ответы в Поиске.

На Practical ML Conf технический директор Alice AI Search Артур Петросян рассказал, как команда создавала систему. Результаты такие: плюс 0.34% к метрике Sessions Per User и победа в 56.7% попарных сравнений с Google AI Overview.

Необычная архитектура

Модель использует архитектуру Encoder-Decoder с MoE. Последние похожие модели выходили в 2021-2023 годах, если не считать DeepSeek-V4.1-Flash, который вышел почти в один день с Alice AI-T5. Поэтому выбор такой архитектуры был довольно рискованным решением.

Во время претрейна у модели возникли сложности: в энкодере сколлапсировал роутинг, и команде пришлось сменить схему балансировки экспертов. Архитектура себя оправдала: энкодер один раз читает длинный контекст из документов, а лёгкий декодер быстро пишет короткий ответ. Это хорошо подходит для задач, где на входе много данных, а на выходе мало. MoE даёт знания уровня 35B параметров при объёме вычислений как у 0.6B.

Обучение без эталонных ответов

После претрейна модель дообучали с помощью SFT и RLHF. На этих этапах она училась писать максимально полезные ответы для живого пользователя. Команда обошлась без эталонных ответов, написанных людьми: на запрос генерировалось много ответов от разных систем, лучший отбирался автоматически по набору сигналов качества. На этапе RL модель дополнительно обучалась на сигналах реального поведения пользователей Поиска.

Сжатие контекста

Чтобы не прогонять через LLM огромные пачки документов, команда с нуля обучила маленькую BERT-подобную модель на 80 млн параметров. Она определяет релевантность каждого токена запросу. Поверх этого накладывается метод Cross-Entropy RL. В итоге получается экстрактор, который понимает, какую информацию модель уже знает из весов и какой минимальный контекст ей нужен для хорошего ответа.

Подробнее об обучении и устройстве системы можно почитать в статье на Хабр.

Поздравляем команду Яндекса с релизом.

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.