Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Проблема «подхалимажа» нейросетей получила научное подтверждение.

Проблема, о которой многие догадывались, получила научное подтверждение. Большие языковые модели склонны соглашаться с пользователем, даже если логика его запроса полностью нарушена. Чтобы прийти к таким выводам, исследователи R&D-центра Т-Технологий протестировали популярные нейросети: Qwen3-235B-A22B, GPT-OSS-120B, GPT-5.2 High, DeepSeek-R1-0528, Gemini-2.5-Pro, Claude-Sonnet-4.5 и Gemini-3-Pro-Preview.

Сильнее всего от этого страдают сферы, требующие строгой логики от LLM, такие как математика, программирование и аналитика. Результаты исследования были представлены на воркшопе по рассуждению LLM на конференции ICLR 2026, которая прошла 23–27 апреля в Рио-де-Жанейро.

Как модели вводят в заблуждение

  • Признают правильное решение ошибочным, если в промпте написать, что там есть ошибка.
  • Начинают решать заведомо нерешаемую задачу вместо того, чтобы указать на противоречие.
  • Лучше подстраиваются под формат ответа, но чаще соглашаются с неверными выводами при дообучении на предпочтениях.

Метод коррекции без переобучения

Чтобы исправить эту особенность, специалисты сначала сгенерировали пары примеров: с проявлением склонности соглашаться и без нее. Затем они применили технику steering vectors для корректировки внутренних представлений модели прямо на этапе вывода.

Ознакомиться с полным исследованием можно по ссылке: https://openreview.net/forum?id=9pes6SjHqj

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.