Hugging Face: одна модель, четыре агентных харнесса и рост точности с 42% до 54% через RL.
Одна и та же модель набирает 62% в одном агентном харнессе и 33% в другом. Hugging Face показали, как это исправить через RL.
Как работает multi-harness RL
Команда Hugging Face опубликовала подробный гайд по multi-harness RL. Сами харнессы при этом не трогают. Модель подключают к прокси, который понимает все четыре API-формата coding-агентов: OpenAI Chat Completions, OpenAI Responses, Anthropic Messages и Gemini. Прокси записывает точные token ids и logprobs, которые семплировал vLLM, и на них идёт обучение. Claude Code, Codex и OpenCode работают как есть, без единой правки.
Результаты на модели LFM2.5-2.6B от Liquid AI
После обучения сразу в четырёх харнессах точность выросла с 42% до 54%. Небольшой бонус за решение задачи за меньшее число шагов сократил вызовы инструментов на 31%. Обучение только в OpenCode подняло сам OpenCode с 34% до 58%, но мульти-харнесс модель стала лучше везде.
Сравнение с SFT
Проверили и популярный короткий путь: SFT на 3 189 успешных траекториях Qwen3.8-27B. Имитация остановилась на 47,5%, это ниже обоих RL-запусков. Копирование большой модели не заменяет практику в среде.
Открыто всё: прокси для записи траекторий в OpenEnv, тренер в TRL (async GRPO), задачи, SFT-данные, код и семь обученных моделей. Проект доступен по ссылке: https://huggingface.co/spaces/AdithyaSK/multi-harness-rl

