Fable возвращается: почему Anthropic ужесточила цензуру и подключает правительство США?
Anthropic снова открыла доступ к своей нейросети Fable, но с рядом существенных изменений. По данным компании, модель теперь «подрезали» не по качеству, а по количеству запросов, на которые она будет отвечать. В системы классификации, оценивающие вредоносность запросов пользователей, стали добавлять больше ложноположительных пограничных примеров, чтобы модель работала с гипертрофированной осторожностью. В результате чувствительность к подозрительным запросам на внутренних тестах достигла более 99%. Однако, как часто бывает в машинном обучении, рост Recall привел к падению Precision: теперь Fable будет блокировать гораздо больше безопасных запросов, особенно на темы, связанные с безопасностью и медициной.
Но Anthropic не стала замыкаться только на себе. Компания продемонстрировала правительству США, что находить эксплойты могут не только их нейросети, но и GPT-5.4, GPT-5.5, Kimi K2.7, а также старые версии Opus. На этом фоне Anthropic предложила себя в качестве «народных дружинников» по поиску путей джейлбрейка моделей, созданию защитных механизмов и информированию властей о том, «кто в зоне риска». Речь идёт не только о собственных продуктах, но и о любых моделях, развивших «передовые возможности в областях, критичных для государственной безопасности». Идея пришлась по вкусу Национальному Цифровому Директору (реальная должность в США).
Для оценки угрозы к процессу подключатся Microsoft, Amazon, Google и другие партнеры из Project Glasswing — именно им изначально выкатывали Mythos в закрытом режиме. Совместно они разрабатывают фреймворк, который оценивает джейлбрейки по нескольким критериям:
- Серьезность преимущества. Насколько взломанная модель превосходит более слабые. Чем значительнее отрыв, тем хуже. Здесь же, по сути, Anthropic и правительство США проводят красную линию: с определённого момента модели признаются опасными.
- Широта джейлбрейка. Насколько широкий спектр нежелательных способностей открывает метод. Чем больше, тем хуже.
- Трудоемкость взлома. Оценивается, насколько легко обычному пользователю его осуществить. Простота = высокий риск.
- Распространенность. Чем известнее джейлбрейк в сети, тем опаснее.
Что происходит?
Мы наблюдаем типичную картину для вычислительных устройств и алгоритмов. Главный кошмар для государства и любых институтов, работающих с деньгами, вооружениями или безопасностью — невозможность защититься от взлома. В этой сфере традиционно соревнуются криптографы и специалисты по безопасности, противостоящие хакерам. Теперь же AI достиг такого уровня (или Anthropic всех убедительно напугала), что безопасники начали считать его серьезной угрозой для взлома критически важного ПО.
Поэтому неизбежно появление полноценной отрасли AI-безопасности, антивирусов для нейросетей и серого рынка джейлбрейков. Специалисты будут продавать как сами методы «развязывания рук» AI, так и данные, добытые с помощью взломанных моделей. Страшно представить, что случится, когда квантовые вычисления позволят взламывать традиционные ключи шифрования за секунды — и такой инструмент окажется в руках взломанного AI.
Тем временем Anthropic запустила официальную программу поиска уязвимостей на HackerOne: исследователи могут попробовать найти джейлбрейки для Fable 5 и получить вознаграждение (подробности).
P.S. GPT-5.6 пока остается в закрытом бета-тесте для избранных. Но куда интереснее ситуация с китайскими моделями, которые активно дышат в спину Mythos. Теперь это будет восприниматься как полноценная угроза национальной безопасности США, особенно с учётом того, что Китай открывает исходный код едва ли не каждой второй модели.

