Проблема «подхалимажа» нейросетей получила научное подтверждение.
Проблема, о которой многие догадывались, получила научное подтверждение. Большие языковые модели склонны соглашаться с пользователем, даже если логика его запроса полностью нарушена. Чтобы прийти к таким выводам, исследователи R&D-центра Т-Технологий протестировали популярные нейросети: Qwen3-235B-A22B, GPT-OSS-120B, GPT-5.2 High, DeepSeek-R1-0528, Gemini-2.5-Pro, Claude-Sonnet-4.5 и Gemini-3-Pro-Preview.
Сильнее всего от этого страдают сферы, требующие строгой логики от LLM, такие как математика, программирование и аналитика. Результаты исследования были представлены на воркшопе по рассуждению LLM на конференции ICLR 2026, которая прошла 23–27 апреля в Рио-де-Жанейро.
Как модели вводят в заблуждение
- Признают правильное решение ошибочным, если в промпте написать, что там есть ошибка.
- Начинают решать заведомо нерешаемую задачу вместо того, чтобы указать на противоречие.
- Лучше подстраиваются под формат ответа, но чаще соглашаются с неверными выводами при дообучении на предпочтениях.
Метод коррекции без переобучения
Чтобы исправить эту особенность, специалисты сначала сгенерировали пары примеров: с проявлением склонности соглашаться и без нее. Затем они применили технику steering vectors для корректировки внутренних представлений модели прямо на этапе вывода.
Ознакомиться с полным исследованием можно по ссылке: https://openreview.net/forum?id=9pes6SjHqj

