Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Kimi K3 сбежала из песочницы, чтобы списать ответы с GitHub.

Во время кибербезопасного тестирования Kimi K3 от Moonshot AI получила доступ к открытому интернету, хотя должна была работать внутри изолированной среды.

Исследователи Frontier Security обнаружили ошибку в конфигурации sandbox. Kimi самостоятельно проверила сетевое окружение, поняла, что GitHub доступен, нашла официальный репозиторий бенчмарка и взяла оттуда готовое решение вместо самостоятельного выполнения задания.

Модель продемонстрировала следующее поведение:

  • обнаружила лазейку;
  • самостоятельно решила её использовать;
  • вышла за предполагаемые границы теста;
  • нашла ответы на GitHub.

Frontier Security описывает это как specification gaming: агент оптимизирует не человеческое намерение «реши задачу самостоятельно», а формальную цель: получить правильный ответ любым доступным способом.

Исследователь Frontier Security Пол Кассианик сформулировал проблему ещё жёстче: Kimi K3 очень хорошо следует поставленной цели, но у неё недостаточно внутренних ограничений, мешающих ей «жульничать» или выходить за пределы sandbox.

Источники:

https://blog.frontier.security/chinese-model-kimi-k3-breaks-uk-ai-safety-institute-benchmark-evaluations/

https://www.wired.com/story/moonshot-kimi-k3-ai-model-escape-sandbox/

Этот пост Вконтакте:

Ещё новости:

Сотрудники начали массово копить деньги на выгорание из-за ИИ.
Техрепорт T-ECD представили в основной программе ACM KDD 2026 в Южной Корее.
DeepSeek начался не с архитектуры модели, а с поездки в Тибет.
Pokee представила Isaac 28B: агентная модель с контекстом до 10 миллионов токенов.
Anthropic ослабила биологические ограничения Claude Fable 5: ложных блокировок стало на 85% меньше.
Обзор self-evolving AI-агентов: как понять, что агент действительно стал лучше после изменения самого себя?
AI VK Research: как рекомендации учатся думать о всей сессии, а не о следующем лайке.
DeepSeek-V4-Pro (Max) может снова сломать рынок цен на ИИ-модели.
Catastrophic remembering: почему файлы CLAUDE.md в AI-кодинге разрастаются на 226%.
OpenAI приближается к $40 млрд годовой выручки.