Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Как стиль подачи заставляет LLM верить в ложь: исследование EoBench.

Мы изучили свежее исследование от EoBench, которое показывает, что одна и та же ложь может по-разному влиять на большие языковые модели (LLM) в зависимости от тона, уверенности и грамматической формы. Тонкость в том, что даже незначительное изменение стиля способно заставить модель принять ложный факт за истинный.

Авторы собрали около 66 тысяч ложных утверждений в 19 различных стилях и протестировали 18 моделей из семейств Gemma, Llama и Qwen. Для чистоты эксперимента использовались только те факты, которые каждая модель изначально знала правильно.

Какие стили сработали лучше всего? Модели чаще верили лжи, если она подавалась в виде:

  • приказов;
  • формального языка;
  • обращения как к ребёнку;
  • ссылок на авторитет;
  • уверенной подачи.

Хуже всего срабатывали слабые формулировки и контрфактические утверждения.

Также выяснилось, что крупные модели реже попадаются на удочку ложного контекста, а instruction tuning (дообучение на инструкциях) обычно повышает их устойчивость.

Вывод для всех, кто работает с LLM: оценивать модели необходимо с учётом формы запроса. Даже небольшое изменение формулировки может заметно повлиять на ответ.

Подробнее в статье «It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief»: arxiv.org/abs/2607.18232.

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.