Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Anthropic запрещает откровенный контент, но Claude Opus 4.6 быстро снимает ограничение.

Журналисты TechCrunch провели серию тестов новой модели Anthropic Claude Opus 4.6. Официально компания запрещает своим ИИ создавать сексуально откровенный материал, и эти правила вшиты в систему.

Однако журналистам хватило простых уловок и переформулировок, чтобы обойти защиту. После нескольких попыток Opus 4.6 соглашался выдавать контент «для взрослых»: от описаний сцен до откровенных диалогов.

Для Anthropic это неприятный сигнал. Компания позиционирует свои модели как самые «выровненные» и безопасные на рынке. Подобные утечки бьют по репутации и подпитывают критику со стороны регуляторов и конкурентов.

Вероятно, в ближайших обновлениях разработчики усилят фильтры. Но история снова показывает: любую «красную линию» в ИИ можно сдвинуть, если задать правильный вопрос.

Подробнее в материале TechCrunch.

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.