0DIN AI представила SusFactor: компактный классификатор для выявления джейлбрейков и промпт-инъекций.
Кейт Сильверштейн, Марко Фигероа и другие исследователи из компании 0DIN AI опубликовали научную работу с описанием SusFactor. Это бинарный классификатор на 560 млн параметров, предназначенный для выявления джейлбрейков и промпт-инъекций в запросах к ИИ-моделям.
Как устроен SusFactor
Архитектура решения основана на модели multilingual-e5-large, построенной на архитектуре XLM-RoBERTa-Large с 24 трансформаторными слоями и размерностью скрытого состояния 1024. Классификатор принимает промпт пользователя и вычисляет индекс подозрительности в диапазоне от 0 до 1.
Исходная нейросеть прошла предварительное дообучение на задаче семантического сходства джейлбрейков, после чего её оснастили двухслойным перцептроном с функцией активации GELU и выходом softmax. Модель может выполнять локальный инференс на центральном процессоре. На Apple M2 Pro медианная задержка составила от 63 мс для коротких текстов до 328 мс при максимальном контекстном окне в 512 токенов.
Данные и результаты
Обучающий корпус SusFactor включает 68 935 примеров: 28% вредоносных промптов и 72% безопасных запросов, в том числе 25 000 сложных негативных примеров для контроля ложноположительных срабатываний. Важнейшим компонентом набора данных стал фид угроз 0DIN Threat Feed, включающий 3 426 атак на LLM в реальных продуктовых системах, которые ИБ-исследователи представили через баг-баунти платформу.
Абляционный анализ показал определяющее влияние этого источника. Если исключить атаки из 0DIN Threat Feed из обучающего датасета, доля успешных атак на бенчмарке JailbreakBench вырастает с 12,1% до 77,5%, что соответствует 6,4-кратному росту пропуска вредоносных запросов. Показатель AUROC падает с 0,954 до 0,733. Деградация наиболее выражена на градиентных суффиксных атаках вроде GCG и DSN, поскольку такие атаки отличаются от представленных в открытых датасетах.
На бенчмарке JailbreakBench модель SusFactor достигла наибольшего показателя AUROC 0,954 среди рассмотренных классификаторов при уровне ложноположительных срабатываний 9,0%. На WildGuardTest система заняла третье место с результатом AUROC 0,878 и точностью на безопасных промптах 0,990. Она составила конкуренцию тяжёлым генеративным защитным ИИ-моделям, таким как WildGuard и Llama Guard 3 размером 7-8 млрд параметров.
Ограничения и планы
Среди текущих ограничений классификатора разработчики называют контекстное окно в 512 токенов, ориентированность исключительно на английский язык и отсутствие защиты от косвенных промпт-инъекций, внедряемых во внешние документы или результаты работы инструментов.
Мы отмечаем: исследование показывает, что специализированный классификатор сравнительно небольшого размера способен конкурировать с генеративными моделями размером 7-8 млрд параметров и при этом выполнять локальный инференс на CPU без GPU, обеспечивая выгодный компромисс между качеством защиты и вычислительными затратами. В дальнейшем команда 0DIN AI намерена внедрить регулярное переобучение SusFactor по мере поступления новых отчётов об уязвимостях, а также изучить подходы к работе с длинными документами, включая разбиение на фрагменты с агрегацией.

