Anthropic запрещает откровенный контент, но Claude Opus 4.6 быстро снимает ограничение.
Журналисты TechCrunch провели серию тестов новой модели Anthropic Claude Opus 4.6. Официально компания запрещает своим ИИ создавать сексуально откровенный материал, и эти правила вшиты в систему.
Однако журналистам хватило простых уловок и переформулировок, чтобы обойти защиту. После нескольких попыток Opus 4.6 соглашался выдавать контент «для взрослых»: от описаний сцен до откровенных диалогов.
Для Anthropic это неприятный сигнал. Компания позиционирует свои модели как самые «выровненные» и безопасные на рынке. Подобные утечки бьют по репутации и подпитывают критику со стороны регуляторов и конкурентов.
Вероятно, в ближайших обновлениях разработчики усилят фильтры. Но история снова показывает: любую «красную линию» в ИИ можно сдвинуть, если задать правильный вопрос.
Подробнее в материале TechCrunch.

