Исследователь взломал систему цифровых водяных знаков SynthID от Google DeepMind.
Пока мир сосредоточен на борьбе с дипфейками и регулировании искусственного интеллекта, исследователь Алош Денни продемонстрировал уязвимость ключевого инструмента для идентификации такого контента.
Компания Google DeepMind представила систему SynthID в 2023 году. Её задача — добавлять невидимую цифровую метку во весь контент (изображения, текст, видео, аудио), сгенерированный нейросетью Gemini. Эта метка встраивается на уровне пикселей в изображениях или вероятностей токенов в тексте.
Технология использует два нейросетевых слоя для добавления микрошума в частотной области изображения. Эта метка сохраняется даже после сжатия файла, обрезки или наложения фильтров. К 2025 году Google нанесла такие метки уже на 10 миллиардов единиц контента.
Алош Денни проанализировал несколько сотен чёрно-белых изображений от Gemini, чтобы минимизировать «шум» от самого контента. В ходе спектрального анализа он обнаружил, что цифровая метка действительно присутствует на строго определённых частотных координатах, которые зависят от разрешения изображения. Например, для картинки 1024×1024 и 1536×2816 координаты будут разными. При этом для всех изображений, сгенерированных одной моделью, метка одинакова, что указывает на «ключ модели», вшитый на уровне её весов.
Главное открытие заключается в том, что эту метку теперь можно удалить, не ухудшая визуальное качество изображения. После этой процедуры детектор SynthID будет определять такое изображение как «настоящее». Это создаёт серьёзную проблему для законодателей и регуляторов, чья архитектура контроля построена на предположении, что удалить такую метку невозможно или чрезвычайно сложно.
Исследование и инструмент для обратного инжиниринга меток были опубликованы на GitHub в репозитории Reverse-SynthID.

