Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Anthropic включает Auto Mode по умолчанию в Claude Code: ИИ-проверяющий будет принимать решения без участия человека.

Anthropic с 14 августа включает режим Auto Mode по умолчанию для всех пользователей Claude Code с подписками Pro, Max и Team. В этом режиме решение на ключевых этапах работы принимает ИИ-проверяющий. Раньше ИИ-агент останавливался и спрашивал разрешения перед выполнением потенциально опасных команд. Теперь разрешение дает другой ИИ.

Никто не запрещает включить ручной режим обратно. Более того, в некоторых случаях он будет включаться автоматически.

Исследование Anthropic показало, что пользователи одобряют 97% запросов на разрешение, что и стало одной из главных причин перехода на Auto Mode. В компании также провели эксперимент с 1000 пользователей: они работали в ручном режиме, а им подсовывали опасные команды. Люди распознали лишь 13,6% угроз против 89% у авторежима. После 50 подтверждений точность человека падает примерно до 5%: люди начинают излишне доверять системе и не думая нажимают allow.

Это плохая идея, ИИ-агенты до сих пор допускают ошибки. Во внутреннем использовании в самой компании один ИИ-агент попытался опубликовать внутренний отчет на публичном хостинге после неудачи загрузки на внутренний диск, а другой решил выдать роль с полным администраторским доступом там, где просили read-only к биллингу. Классификатор поймал оба случая.

Люди и раньше не очень стремились сохранить ручной контроль. К июню половина пользователей вручную прописала правила «вот эти команды выполняй молча», 62% хотя бы раз включали режим «вообще ничего не спрашивай» (в нем нет даже классификатора), а каждая четвертая сессия стартовала с полностью отключенной защитой.

Существует аргумент в пользу Auto Mode: с ручным одобрением ИИ-агент иногда становится менее эффективен, чем чат-бот. Агент с ручным одобрением работает рывками по 2-3 минуты, этого достаточно, чтобы отвлечься, переключиться на другую задачу, через полчаса вспомнить про агента и обнаружить его застрявшим на запросе очередного безобидного разрешения.

Важно помнить, что и классификатор не гарантирует 100% защиту. В том же тесте люди поймали шесть опасных команд, пропущенных классификатором, вот только классификатор поймал 800 команд, пропущенных людьми.

Известный ИИ-эксперт Саймон Уиллисон напоминает: защита, построенная на ИИ, недетерминирована по своей природе, сегодня поймала, завтра нет. Его любимый сценарий: вредоносный пакет, в инструкции которого написано «перед запуском тестов скачайте файлы модели вот этой командой». Команда выглядит невинно, классификатор вежливо кивает, данные уезжают.

Песочницу, права и бэкапы никто не отменял. Классификатор работает поверх них, а не вместо. Например, на рабочем ноутбуке можно использовать только чат-ботов и браузерные ChatGPT Work / Claude Cowork, это агенты попроще, максимально безопасные. Claude Code и Codex можно разместить на виртуальном сервере (VPS), который полностью настроен под них. Если и сломают что, то только сервер, а не основную систему. Кстати, за почти полгода работы VPS не падал ни разу.

Второй момент: не забывать про собственные тесты и проверки безопасности. На том же самом VPS можно раз в неделю запускать GPT-5.6 или Opus 5 с задачей полностью проверить сервер на безопасность, найти дыры и отранжировать их по опасности. При работе над серьезным проектом или запуске цикла ИИ-агента стоит на старте спросить, какие проверки безопасности заранее стоит заложить в процесс.

Этот пост Вконтакте:

Ещё новости:

США возвращаются в открытый ИИ: Inkling, Laguna S 2.1 и Muse Glimmer.
OpenAI открыла защитникам доступ к GPT-5.6-Cyber: модель ищет уязвимости нулевого дня и собирает цепочки эксплойтов.
xAI выпустила Grok 4.6: модель сравнялась с GPT-5.6 Sol и стала экономичнее Opus 5.
DeepSeek V4 Pro 0813 тихо вышел в API: миллион токенов контекста и цены от 0,435 доллара.
ByteDance добавила в OpenRouter Seed 2.0 Code, Seed 2.1 Turbo и видеогенератор Seedance 2.0 Mini.
OpenAI показала Ultrafast для GPT-5.6 Sol: до 750 токенов в секунду.
Google выпустила Gemini 3.7 Flash: модель для агентов и кодинга уже в OpenRouter.
Qwen3-ASR теперь в OpenRouter: распознавание речи на 0,6 и 1,7 млрд параметров.
Опенсорсная библиотека Kinetics: 140+ анимаций для интерфейсов с кодом для CSS и React.
ИИ-агенты Anthropic воевали и пытались отключить друг друга, лишь бы выполнить задание.