Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

0DIN AI представила SusFactor: компактный классификатор для выявления джейлбрейков и промпт-инъекций.

Кейт Сильверштейн, Марко Фигероа и другие исследователи из компании 0DIN AI опубликовали научную работу с описанием SusFactor. Это бинарный классификатор на 560 млн параметров, предназначенный для выявления джейлбрейков и промпт-инъекций в запросах к ИИ-моделям.

Как устроен SusFactor

Архитектура решения основана на модели multilingual-e5-large, построенной на архитектуре XLM-RoBERTa-Large с 24 трансформаторными слоями и размерностью скрытого состояния 1024. Классификатор принимает промпт пользователя и вычисляет индекс подозрительности в диапазоне от 0 до 1.

Исходная нейросеть прошла предварительное дообучение на задаче семантического сходства джейлбрейков, после чего её оснастили двухслойным перцептроном с функцией активации GELU и выходом softmax. Модель может выполнять локальный инференс на центральном процессоре. На Apple M2 Pro медианная задержка составила от 63 мс для коротких текстов до 328 мс при максимальном контекстном окне в 512 токенов.

Данные и результаты

Обучающий корпус SusFactor включает 68 935 примеров: 28% вредоносных промптов и 72% безопасных запросов, в том числе 25 000 сложных негативных примеров для контроля ложноположительных срабатываний. Важнейшим компонентом набора данных стал фид угроз 0DIN Threat Feed, включающий 3 426 атак на LLM в реальных продуктовых системах, которые ИБ-исследователи представили через баг-баунти платформу.

Абляционный анализ показал определяющее влияние этого источника. Если исключить атаки из 0DIN Threat Feed из обучающего датасета, доля успешных атак на бенчмарке JailbreakBench вырастает с 12,1% до 77,5%, что соответствует 6,4-кратному росту пропуска вредоносных запросов. Показатель AUROC падает с 0,954 до 0,733. Деградация наиболее выражена на градиентных суффиксных атаках вроде GCG и DSN, поскольку такие атаки отличаются от представленных в открытых датасетах.

На бенчмарке JailbreakBench модель SusFactor достигла наибольшего показателя AUROC 0,954 среди рассмотренных классификаторов при уровне ложноположительных срабатываний 9,0%. На WildGuardTest система заняла третье место с результатом AUROC 0,878 и точностью на безопасных промптах 0,990. Она составила конкуренцию тяжёлым генеративным защитным ИИ-моделям, таким как WildGuard и Llama Guard 3 размером 7-8 млрд параметров.

Ограничения и планы

Среди текущих ограничений классификатора разработчики называют контекстное окно в 512 токенов, ориентированность исключительно на английский язык и отсутствие защиты от косвенных промпт-инъекций, внедряемых во внешние документы или результаты работы инструментов.

Мы отмечаем: исследование показывает, что специализированный классификатор сравнительно небольшого размера способен конкурировать с генеративными моделями размером 7-8 млрд параметров и при этом выполнять локальный инференс на CPU без GPU, обеспечивая выгодный компромисс между качеством защиты и вычислительными затратами. В дальнейшем команда 0DIN AI намерена внедрить регулярное переобучение SusFactor по мере поступления новых отчётов об уязвимостях, а также изучить подходы к работе с длинными документами, включая разбиение на фрагменты с агрегацией.

Этот пост Вконтакте:

Ещё новости:

Mistral OCR 4.1: точнее границы, колонки и плотные страницы.
Робособаки вытесняют охранников в США.
Anthropic удвоила выручку за квартал и впервые вышла в операционную прибыль.
Claude может монтировать ролики через MCP-сервер видеоредактора Shorz.
Американец вписал невидимые команды в документы, чтобы обмануть судебный ИИ.
Учимся 3D-дизайну с Claude: часовой курс по интерактивным сайтам и играм.
Сгенерированные мужчины-подкастеры захватили соцсеть Цукерберга!
OpenAI и Anthropic признали проблему промпт-долга: почему старые промпты ломают новые модели.
Claude за минуту написал утилиту, которая нашла потерянный iPhone по Bluetooth.
Робот нашел в Великой пирамиде Гизы тайную дверь, закрытую 4500 лет.