Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

RL-дообучение улучшает лёгкие задачи, но не трудные: разбор Olmo 3.1 RL-Zero Math и метод Never Give Up.

Мы видим, что RL-дообучение улучшает модель пропорционально тому, что она уже умеет: лёгкие задачи становятся легче, трудные почти не сдвигаются. Автор модели Olmo 3.1 RL-Zero Math разбирает это на AIME.

Если разбить 30 задач на три корзины по стартовому pass@1 (0%, 3,8% и 22,7%), почти весь рост средней метрики даёт переход лёгких задач из «иногда решаю» в «в основном решаю». Та же картина на code RL у Deepcoder и на агентном RL у DeepSWE.

Причина не только в том, что на трудную задачу не выпадает ни одного верного ответа и градиента нет. Большой k, по 32 сэмпла на промпт, чаще ловит редкое решение трудной задачи, но ещё чаще ловит редкую ошибку на лёгкой, и батч забивается лёгкими задачами. В эксперименте на GSM8k маленький k=4 после 200 шагов обгоняет k=32.

Предложенный метод Never Give Up: сэмплировать по 4, задачу с нулём верных ответов с вероятностью 0,9 отправлять на новый круг, а решённую 4 из 4 отфильтровывать сразу. На GSM8k это обходит GRPO с любым фиксированным k, сильнее всего на трудной корзине. Статья доступна на arXiv, код опубликован в источнике.

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.