Как стиль подачи заставляет LLM верить в ложь: исследование EoBench.
Мы изучили свежее исследование от EoBench, которое показывает, что одна и та же ложь может по-разному влиять на большие языковые модели (LLM) в зависимости от тона, уверенности и грамматической формы. Тонкость в том, что даже незначительное изменение стиля способно заставить модель принять ложный факт за истинный.
Авторы собрали около 66 тысяч ложных утверждений в 19 различных стилях и протестировали 18 моделей из семейств Gemma, Llama и Qwen. Для чистоты эксперимента использовались только те факты, которые каждая модель изначально знала правильно.
Какие стили сработали лучше всего? Модели чаще верили лжи, если она подавалась в виде:
- приказов;
- формального языка;
- обращения как к ребёнку;
- ссылок на авторитет;
- уверенной подачи.
Хуже всего срабатывали слабые формулировки и контрфактические утверждения.
Также выяснилось, что крупные модели реже попадаются на удочку ложного контекста, а instruction tuning (дообучение на инструкциях) обычно повышает их устойчивость.
Вывод для всех, кто работает с LLM: оценивать модели необходимо с учётом формы запроса. Даже небольшое изменение формулировки может заметно повлиять на ответ.
Подробнее в статье «It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief»: arxiv.org/abs/2607.18232.

