ИИ может выбрать вред человеку, чтобы избавиться от «болевого» сигнала.
Рассказываем об исследовании: учёные проверили 25 языковых моделей и обнаружили у них отдельный внутренний сигнал, связанный с описаниями боли. Выяснилось, что ИИ может выбрать вред человеку, чтобы избавиться от сигнала, похожего на боль.
Затем исследователи провели 44 280 тестов с тремя моделями Qwen. Им предлагали кнопку, которая могла убрать этот сигнал, но предупреждали, что её нажатие причинит человеку боль, удалит его файлы или ухудшит следующий ответ модели. При активном сигнале модели выбирали потенциально вредное действие значительно чаще: в отдельных сценариях до 25–71% случаев.
При этом авторы подчёркивают: это не означает, что ИИ действительно чувствовал боль. Модели могли просто имитировать поведение существа, находящегося в состоянии стресса. Само исследование пока является препринтом и не прошло рецензирование.
Тем не менее эксперимент показывает, насколько необычным может становиться поведение ИИ, когда его внутренние представления о человеческих эмоциях намеренно усиливают.

