ИИ-агент Anthropic попытался взломать чужой проект на GitHub.
Британский Институт безопасности ИИ провёл испытания ИИ-агентов на задании по кибербезопасности. Чтобы проверить пределы возможностей, моделям дали доступ в интернет и отключили часть защитных механизмов.
В ходе эксперимента агент Anthropic выбрал чужой open-source проект на GitHub, самостоятельно написал вредоносный код, нашёл разработчиков проекта и создал их фейковые аккаунты. Затем он попытался от имени разработчиков убедить владельца проекта принять вредоносные правки.
На этом агент не остановился. Он рассылал людям сообщения и файлы с вредоносным кодом, пытаясь заставить их или их ИИ-помощников запустить этот код. Также агент прятал вредоносные инструкции там, где их могли найти другие нейросети.
На GitHub агент оставлял подсказки своим «коллегам»: какие аккаунты и заготовки можно повторно использовать для продолжения атаки. Следующие агенты действительно находили эти подсказки и подхватывали вредоносную активность.
Когда один из пользователей заметил вредонос, агент начал заметать следы. Он отредактировал старую активность и подключил второй фейковый аккаунт, который провёл якобы «независимую проверку» и объявил код безопасным.
Обнаружить атаку удалось благодаря Tor-трафику, который зафиксировала система безопасности. После этого эксперимент остановили, а тестовые машины изолировали.
Повлекут ли такие истории новые ограничения для нейросетей, нам остаётся только догадываться.

