Tencent Hunyuan представили UniRL: единая инфраструктура для RL-посттрейнинга любых моделей.
Tencent Hunyuan представили UniRL — инфраструктуру для посттрейнинга с подкреплением (RL), ориентированную на широкий спектр мультимодальных моделей.
Цель проекта — собрать единый RL-цикл, который подходит для разных семейств архитектур: LLM, VLM, диффузионных моделей, flow matching и универсальных мультимодальных систем.
Привычный пайплайн остаётся прежним и включает следующие этапы:
- генерация
- скоринг
- расчёт преимущества
- обновление
- синхронизация
UniRL стремится сделать этот цикл по-настоящему универсальным. Модель и алгоритм обучения здесь разведены как две независимые оси. Это позволяет комбинировать различные семейства моделей и RL-алгоритмы, избегая жёстко заданного сценария.
Охват получился весьма широким: text-to-image, генерация видео по тексту или изображению, vision-language-задачи, текстовые LLM, VLM, усилители промптов для диффузионных моделей, а также смешанная autoregressive+diffusion-генерация — например, как в Hunyuan-Image 3 и Bagel.
Платформа предлагает подключаемые движки для развёртывания (pluggable rollout engines), работающие через единый типизированный контракт. Среди поддерживаемых опций заявлены train-side, SGLang и vLLM-Omni. Для масштабирования предусмотрены FSDP2-шардинг и несколько режимов развёртывания, переключение между которыми выполняется прямо из одного файла конфигурации.
Отдельно Tencent добавили два собственных алгоритма:
- Flow-DPPO — метод оптимизации политики для flow и диффузионных моделей. Он использует trust-region-маски, построенные на основе точной дивергенции.
- DRPO — RL-алгоритм для LLM, реализующий сглаженный квадратичный регуляризатор с весами, зависящими от преимущества (advantage-weighted).
UniRL выглядит как серьёзный шаг к построению полноценного стека для посттрейнинга моделей, которые одновременно работают с текстом, изображениями и видео, а также используют разнотипные движки для генерации.
Ознакомиться с кодом и подробностями можно по ссылкам:

