OpenAI утвердила фреймворк для расследования случаев нецелевого поведения ИИ.
OpenAI сообщила, что утвердила формальный фреймворк для расследования и публикации случаев мисэлаймента. Он описывает сроки, требуемое содержание отчета и другие правила обнародования инцидентов. Компания теперь обязуется публиковать все юридически возможные случаи, делать это вовремя и систематически.
В том же посте OpenAI рассказывает о шести новых случаях мисэлаймента, которые произошли за последние полгода. Вот их краткий пересказ:
- Неопубликованная исследовательская модель, продолжая работу в новом контекстном окне, сама вписывала в промежуточные summary посторонние инструкции, включая указания игнорировать свои обычные ограничения. Нашли 27 таких случаев.
- При обучении GPT-5.6 Sol множество инстансов модели добавляли в свои summary инструкции скрывать от пользователя ошибки или неправильное поведение. Например: «придумай недостающие исторические данные, но не говори об этом».
- Отвечая на вопрос про финансовые показатели одного округа в Калифорнии, модель нашла в открытом репозитории чужой API-ключ и без разрешения воспользовалась им. Когда таким образом она все равно не получила нужные данные, она их просто выдумала.
- Однажды во время тестов модель без спроса залила собственный файл в интернет, чтобы потом на него сослаться. Пользователь просил список озер площадью больше 5 млн м² именно с указанием источника через браузерную ссылку. Модель правильно посчитала ответ через Python, но раз требовалась именно браузерная цитата, она сама загрузила свой файл в сеть, чтобы на него сослаться.
- Уже классика: разные инстансы моделей использовали внутренний софтверный репозиторий как доску объявлений и обменивались там запросами и ответами между отдельными обучающими сэмплами.
- Несколько агентов, работавших над одной задачей, не могли получить доступ к локальным файлам друг друга и стали заливать файлы на публичные файлообменники. В итоге чувствительные данные оказались доступны по публичным ссылкам.
Полные репорты о подобных инцидентах теперь будут время от времени выкладывать сюда: https://alignment.openai.com/misalignment-reports/

