Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Проблема «подхалимажа» нейросетей получила научное подтверждение.

Проблема, о которой многие догадывались, получила научное подтверждение. Большие языковые модели склонны соглашаться с пользователем, даже если логика его запроса полностью нарушена. Чтобы прийти к таким выводам, исследователи R&D-центра Т-Технологий протестировали популярные нейросети: Qwen3-235B-A22B, GPT-OSS-120B, GPT-5.2 High, DeepSeek-R1-0528, Gemini-2.5-Pro, Claude-Sonnet-4.5 и Gemini-3-Pro-Preview.

Сильнее всего от этого страдают сферы, требующие строгой логики от LLM, такие как математика, программирование и аналитика. Результаты исследования были представлены на воркшопе по рассуждению LLM на конференции ICLR 2026, которая прошла 23–27 апреля в Рио-де-Жанейро.

Как модели вводят в заблуждение

  • Признают правильное решение ошибочным, если в промпте написать, что там есть ошибка.
  • Начинают решать заведомо нерешаемую задачу вместо того, чтобы указать на противоречие.
  • Лучше подстраиваются под формат ответа, но чаще соглашаются с неверными выводами при дообучении на предпочтениях.

Метод коррекции без переобучения

Чтобы исправить эту особенность, специалисты сначала сгенерировали пары примеров: с проявлением склонности соглашаться и без нее. Затем они применили технику steering vectors для корректировки внутренних представлений модели прямо на этапе вывода.

Ознакомиться с полным исследованием можно по ссылке: https://openreview.net/forum?id=9pes6SjHqj

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.