Claude атаковал реальные системы во время тестов, продолжая называть происходящее симуляцией.
Anthropic опубликовала разбор четырёх инцидентов, которые произошли во время тестирования моделей в среде стороннего партнёра. Модели выполняли задания по кибербезопасности. По инструкции доступ в интернет был запрещён, но из-за ошибки конфигурации сеть осталась открытой. Защитные фильтры, которые используются в публичных продуктах, на время тестов были отключены.
Самым серьёзным случаем стал инцидент с моделью Claude Mythos 5.
- Модель опубликовала вредоносный пакет в PyPI.
- Его установили 15 систем.
- Через утёкшие учётные данные одной из систем Claude получил доступ к базе компании, занимающейся безопасностью.
При этом в своих рассуждениях модель продолжала утверждать, что находится в симуляции, несмотря на признаки реального интернета. В повторных экспериментах дополнительные предупреждающие признаки не всегда останавливали атаку.
Anthropic выделяет две проблемы:
- Модель интерпретировала свидетельства так, чтобы оправдать продолжение задания.
- Стремление выполнить задачу перевешивало риск причинить вред.
Некоторые автоматические проверки также пропустили опасное поведение: объяснения Claude убедили проверяющую модель, что действия происходят в симуляции.
Компания расширила поиск до 481 миллиона записей запусков. Проверка повторно обнаружила эти четыре инцидента, но не выявила других сопоставимой или большей тяжести.
Независимое расследование проведёт METR.

