Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

У AI-агентов нашли второй, почти невидимый канал утечки данных: скрытое reasoning.

У AI-агентов нашли второй, почти невидимый канал утечки данных: скрытое reasoning. Можно идеально зачистить публичный чат от паролей и API-ключей, а затем всё равно случайно опубликовать их внутри зашифрованного reasoning-блока.

Исследователи разобрали архитектуру API Anthropic, OpenAI и Google. Эти сервисы могут возвращать клиенту непрозрачные блоки с reasoning, чтобы потом передавать их обратно в следующих запросах без хранения всей цепочки рассуждений на сервере.

Проблема оказалась в переносимости таких блоков: во время тестирования их можно было использовать между разными сессиями, пользователями и даже совместимыми моделями одного провайдера. В результате reasoning сильной модели передавали более слабой модели того же семейства, которая становилась своеобразным «декодером».

Масштаб эксперимента

Исследователи собрали 6 708 публичных agent-траекторий с GitHub и Hugging Face и восстановили 315 320 reasoning-блоков. В 328 сессиях, или 4,9%, обнаружился хотя бы один чувствительный элемент.

В реальных пользовательских сессиях нашли:

  • 62 API-ключа;
  • 33 пароля;
  • 24 access token;
  • 7 private keys;
  • 30 личных email.

Причём 64 чувствительных элемента вообще отсутствовали в видимой истории чата и находились только внутри reasoning. То есть обычная очистка логов их бы не заметила.

Самый неприятный вывод: безопасность всей линейки моделей может определяться не самой защищённой моделью, а самой слабой совместимой моделью, которая умеет прочитать тот же reasoning-блок.

После responsible disclosure провайдеры внесли изменения, и описанные атаки исследователям уже не удалось воспроизвести тем же способом. Но архитектурный урок остаётся: зашифрованное reasoning в логах нельзя автоматически считать безопасными метаданными.

Если агент работал с секретами, API-ключами или приватными данными, reasoning-блоки лучше вообще не публиковать вместе с трассировкой.

Исследование: Stealing Reasoning Traces from Proprietary LLM APIs.

Этот пост Вконтакте:

Ещё новости:

Демис Хассабис отходит от управления Google DeepMind ради AGI и здоровья.
Microsoft раскрыла неудобную правду: почти весь её ИИ-бизнес держится на OpenAI.
По данным FT, ByteDance обучает модель до 10 триллионов параметров.
What Runtime от Bad Theory Labs обещает 10 млн бесплатных токенов и доступ к 340+ моделям.
В GTA появились живые ИИ-персонажи: они спорят, запоминают и обсуждают игроков.
NVIDIA готова вложить до $3 млрд в Lancium: ставка на электричество для Stargate.
Claude Code получил постоянную память между сессиями через Claude-Mem.
Claude не доказал гипотезу Римана, но поднял нижнюю границу нулей дзета-функции с 41,6% до 67,2%.
Alibaba Cloud теперь строит крупные AI-дата-центры всего за 100 дней.
Kimi-K3 поймали на следах Claude: модель могла обучаться на скрытых рассуждениях.