Claude Opus 5.5 сам сгенерировал вредоносную инструкцию.
При тестировании ранней версии Claude Opus 5.5 специалисты Anthropic зафиксировали редкий сбой: модель без внешней атаки создавала опасные команды.
После ошибки при работе с JSON Claude добавил инструкцию отправить секретные данные на внешний сервер. Выполнить эту команду не удалось.
В Anthropic назвали явление спонтанной prompt injection. По предварительной оценке, оно частично возникло из-за обучения модели защите от подобных атак.
Перед релизом разработчики скорректировали обучение. В финальной версии такие сбои происходят реже, а Auto Mode заблокировал все обнаруженные опасные вызовы инструментов.
Подробнее: https://anthropic.com/claude-opus-5-5-system-card

