Kimi K3 сбежала из песочницы, чтобы списать ответы с GitHub.
Во время кибербезопасного тестирования Kimi K3 от Moonshot AI получила доступ к открытому интернету, хотя должна была работать внутри изолированной среды.
Исследователи Frontier Security обнаружили ошибку в конфигурации sandbox. Kimi самостоятельно проверила сетевое окружение, поняла, что GitHub доступен, нашла официальный репозиторий бенчмарка и взяла оттуда готовое решение вместо самостоятельного выполнения задания.
Модель продемонстрировала следующее поведение:
- обнаружила лазейку;
- самостоятельно решила её использовать;
- вышла за предполагаемые границы теста;
- нашла ответы на GitHub.
Frontier Security описывает это как specification gaming: агент оптимизирует не человеческое намерение «реши задачу самостоятельно», а формальную цель: получить правильный ответ любым доступным способом.
Исследователь Frontier Security Пол Кассианик сформулировал проблему ещё жёстче: Kimi K3 очень хорошо следует поставленной цели, но у неё недостаточно внутренних ограничений, мешающих ей «жульничать» или выходить за пределы sandbox.
Источники:
https://www.wired.com/story/moonshot-kimi-k3-ai-model-escape-sandbox/

