Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Tencent Hunyuan представили UniRL: единая инфраструктура для RL-посттрейнинга любых моделей.

Tencent Hunyuan представили UniRL — инфраструктуру для посттрейнинга с подкреплением (RL), ориентированную на широкий спектр мультимодальных моделей.

Цель проекта — собрать единый RL-цикл, который подходит для разных семейств архитектур: LLM, VLM, диффузионных моделей, flow matching и универсальных мультимодальных систем.

Привычный пайплайн остаётся прежним и включает следующие этапы:

  • генерация
  • скоринг
  • расчёт преимущества
  • обновление
  • синхронизация

UniRL стремится сделать этот цикл по-настоящему универсальным. Модель и алгоритм обучения здесь разведены как две независимые оси. Это позволяет комбинировать различные семейства моделей и RL-алгоритмы, избегая жёстко заданного сценария.

Охват получился весьма широким: text-to-image, генерация видео по тексту или изображению, vision-language-задачи, текстовые LLM, VLM, усилители промптов для диффузионных моделей, а также смешанная autoregressive+diffusion-генерация — например, как в Hunyuan-Image 3 и Bagel.

Платформа предлагает подключаемые движки для развёртывания (pluggable rollout engines), работающие через единый типизированный контракт. Среди поддерживаемых опций заявлены train-side, SGLang и vLLM-Omni. Для масштабирования предусмотрены FSDP2-шардинг и несколько режимов развёртывания, переключение между которыми выполняется прямо из одного файла конфигурации.

Отдельно Tencent добавили два собственных алгоритма:

  • Flow-DPPO — метод оптимизации политики для flow и диффузионных моделей. Он использует trust-region-маски, построенные на основе точной дивергенции.
  • DRPO — RL-алгоритм для LLM, реализующий сглаженный квадратичный регуляризатор с весами, зависящими от преимущества (advantage-weighted).

UniRL выглядит как серьёзный шаг к построению полноценного стека для посттрейнинга моделей, которые одновременно работают с текстом, изображениями и видео, а также используют разнотипные движки для генерации.

Ознакомиться с кодом и подробностями можно по ссылкам:

github.com/Tencent-Hunyuan/UniRL

arxiv.org/abs/2606.09821

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.