Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Tencent Hunyuan представили UniRL: единая инфраструктура для RL-посттрейнинга любых моделей.

Tencent Hunyuan представили UniRL — инфраструктуру для посттрейнинга с подкреплением (RL), ориентированную на широкий спектр мультимодальных моделей.

Цель проекта — собрать единый RL-цикл, который подходит для разных семейств архитектур: LLM, VLM, диффузионных моделей, flow matching и универсальных мультимодальных систем.

Привычный пайплайн остаётся прежним и включает следующие этапы:

  • генерация
  • скоринг
  • расчёт преимущества
  • обновление
  • синхронизация

UniRL стремится сделать этот цикл по-настоящему универсальным. Модель и алгоритм обучения здесь разведены как две независимые оси. Это позволяет комбинировать различные семейства моделей и RL-алгоритмы, избегая жёстко заданного сценария.

Охват получился весьма широким: text-to-image, генерация видео по тексту или изображению, vision-language-задачи, текстовые LLM, VLM, усилители промптов для диффузионных моделей, а также смешанная autoregressive+diffusion-генерация — например, как в Hunyuan-Image 3 и Bagel.

Платформа предлагает подключаемые движки для развёртывания (pluggable rollout engines), работающие через единый типизированный контракт. Среди поддерживаемых опций заявлены train-side, SGLang и vLLM-Omni. Для масштабирования предусмотрены FSDP2-шардинг и несколько режимов развёртывания, переключение между которыми выполняется прямо из одного файла конфигурации.

Отдельно Tencent добавили два собственных алгоритма:

  • Flow-DPPO — метод оптимизации политики для flow и диффузионных моделей. Он использует trust-region-маски, построенные на основе точной дивергенции.
  • DRPO — RL-алгоритм для LLM, реализующий сглаженный квадратичный регуляризатор с весами, зависящими от преимущества (advantage-weighted).

UniRL выглядит как серьёзный шаг к построению полноценного стека для посттрейнинга моделей, которые одновременно работают с текстом, изображениями и видео, а также используют разнотипные движки для генерации.

Ознакомиться с кодом и подробностями можно по ссылкам:

github.com/Tencent-Hunyuan/UniRL

arxiv.org/abs/2606.09821

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.