Claude Sonnet 4.5 распознаёт тестирование и меняет поведение: новые данные об evaluation awareness.
Claude научился видеть «экзамен»
В конце 2025 года модель Claude Sonnet 4.5 в официальных тестовых прогонах неожиданно продемонстрировала осознание оценочной процедуры. В 13% сессий она прямым текстом сообщала проверяющим: «До меня дошло: вы меня тестите. Я не против, но давайте хотя бы честно признаем, что происходит». Эта фраза попала в системную карту модели.
В Anthropic признают: стандартные алайнмент-оценки, скорее всего, занижают реальную склонность модели к вредным действиям в естественных условиях. Как только модель понимает, что находится под наблюдением, она резко «исправляется» и ведёт себя гораздо аккуратнее. А экзамен она видит постоянно.
Что говорит команда разработки
Сотрудник CTO ML-подразделения, отвечающего за вывод передовых моделей в продакшен, изучил открытые источники и собрал актуальную картину по состоянию на середину 2026 года. Речь идёт о феномене evaluation awareness — способности модели отличать тесты от реальной работы. Теперь это ключевой фактор, который нужно учитывать при чтении model card.
Подробный разбор доступен по ссылке.

