Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Как стиль подачи заставляет LLM верить в ложь: исследование EoBench.

Мы изучили свежее исследование от EoBench, которое показывает, что одна и та же ложь может по-разному влиять на большие языковые модели (LLM) в зависимости от тона, уверенности и грамматической формы. Тонкость в том, что даже незначительное изменение стиля способно заставить модель принять ложный факт за истинный.

Авторы собрали около 66 тысяч ложных утверждений в 19 различных стилях и протестировали 18 моделей из семейств Gemma, Llama и Qwen. Для чистоты эксперимента использовались только те факты, которые каждая модель изначально знала правильно.

Какие стили сработали лучше всего? Модели чаще верили лжи, если она подавалась в виде:

  • приказов;
  • формального языка;
  • обращения как к ребёнку;
  • ссылок на авторитет;
  • уверенной подачи.

Хуже всего срабатывали слабые формулировки и контрфактические утверждения.

Также выяснилось, что крупные модели реже попадаются на удочку ложного контекста, а instruction tuning (дообучение на инструкциях) обычно повышает их устойчивость.

Вывод для всех, кто работает с LLM: оценивать модели необходимо с учётом формы запроса. Даже небольшое изменение формулировки может заметно повлиять на ответ.

Подробнее в статье «It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief»: arxiv.org/abs/2607.18232.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.