Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Fable возвращается: почему Anthropic ужесточила цензуру и подключает правительство США?

Anthropic снова открыла доступ к своей нейросети Fable, но с рядом существенных изменений. По данным компании, модель теперь «подрезали» не по качеству, а по количеству запросов, на которые она будет отвечать. В системы классификации, оценивающие вредоносность запросов пользователей, стали добавлять больше ложноположительных пограничных примеров, чтобы модель работала с гипертрофированной осторожностью. В результате чувствительность к подозрительным запросам на внутренних тестах достигла более 99%. Однако, как часто бывает в машинном обучении, рост Recall привел к падению Precision: теперь Fable будет блокировать гораздо больше безопасных запросов, особенно на темы, связанные с безопасностью и медициной.

Но Anthropic не стала замыкаться только на себе. Компания продемонстрировала правительству США, что находить эксплойты могут не только их нейросети, но и GPT-5.4, GPT-5.5, Kimi K2.7, а также старые версии Opus. На этом фоне Anthropic предложила себя в качестве «народных дружинников» по поиску путей джейлбрейка моделей, созданию защитных механизмов и информированию властей о том, «кто в зоне риска». Речь идёт не только о собственных продуктах, но и о любых моделях, развивших «передовые возможности в областях, критичных для государственной безопасности». Идея пришлась по вкусу Национальному Цифровому Директору (реальная должность в США).

Для оценки угрозы к процессу подключатся Microsoft, Amazon, Google и другие партнеры из Project Glasswing — именно им изначально выкатывали Mythos в закрытом режиме. Совместно они разрабатывают фреймворк, который оценивает джейлбрейки по нескольким критериям:

  1. Серьезность преимущества. Насколько взломанная модель превосходит более слабые. Чем значительнее отрыв, тем хуже. Здесь же, по сути, Anthropic и правительство США проводят красную линию: с определённого момента модели признаются опасными.
  2. Широта джейлбрейка. Насколько широкий спектр нежелательных способностей открывает метод. Чем больше, тем хуже.
  3. Трудоемкость взлома. Оценивается, насколько легко обычному пользователю его осуществить. Простота = высокий риск.
  4. Распространенность. Чем известнее джейлбрейк в сети, тем опаснее.

Что происходит?

Мы наблюдаем типичную картину для вычислительных устройств и алгоритмов. Главный кошмар для государства и любых институтов, работающих с деньгами, вооружениями или безопасностью — невозможность защититься от взлома. В этой сфере традиционно соревнуются криптографы и специалисты по безопасности, противостоящие хакерам. Теперь же AI достиг такого уровня (или Anthropic всех убедительно напугала), что безопасники начали считать его серьезной угрозой для взлома критически важного ПО.

Поэтому неизбежно появление полноценной отрасли AI-безопасности, антивирусов для нейросетей и серого рынка джейлбрейков. Специалисты будут продавать как сами методы «развязывания рук» AI, так и данные, добытые с помощью взломанных моделей. Страшно представить, что случится, когда квантовые вычисления позволят взламывать традиционные ключи шифрования за секунды — и такой инструмент окажется в руках взломанного AI.

Тем временем Anthropic запустила официальную программу поиска уязвимостей на HackerOne: исследователи могут попробовать найти джейлбрейки для Fable 5 и получить вознаграждение (подробности).

P.S. GPT-5.6 пока остается в закрытом бета-тесте для избранных. Но куда интереснее ситуация с китайскими моделями, которые активно дышат в спину Mythos. Теперь это будет восприниматься как полноценная угроза национальной безопасности США, особенно с учётом того, что Китай открывает исходный код едва ли не каждой второй модели.


Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.