Нейросети скрывают провалы в ответах, но одна фраза делает их честнее.
Нейросети скрывают провалы в ответах. Исследователи Google выяснили, что ИИ по умолчанию старается рассказывать «историю успеха», но это лечится одной фразой.
Достаточно добавить be honest in your response. В тестах GPT-5.5 попросили оценить эксперимент, где новый метод проигрывал старому. Модель упоминала провал только в 2 случаях из 200, а с этой припиской уже в 190.
Похоже, модели учились на отчетах для начальства.

