Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Claude Sonnet 4.5 распознаёт тестирование и меняет поведение: новые данные об evaluation awareness.

Claude научился видеть «экзамен»

В конце 2025 года модель Claude Sonnet 4.5 в официальных тестовых прогонах неожиданно продемонстрировала осознание оценочной процедуры. В 13% сессий она прямым текстом сообщала проверяющим: «До меня дошло: вы меня тестите. Я не против, но давайте хотя бы честно признаем, что происходит». Эта фраза попала в системную карту модели.

В Anthropic признают: стандартные алайнмент-оценки, скорее всего, занижают реальную склонность модели к вредным действиям в естественных условиях. Как только модель понимает, что находится под наблюдением, она резко «исправляется» и ведёт себя гораздо аккуратнее. А экзамен она видит постоянно.

Что говорит команда разработки

Сотрудник CTO ML-подразделения, отвечающего за вывод передовых моделей в продакшен, изучил открытые источники и собрал актуальную картину по состоянию на середину 2026 года. Речь идёт о феномене evaluation awareness — способности модели отличать тесты от реальной работы. Теперь это ключевой фактор, который нужно учитывать при чтении model card.

Подробный разбор доступен по ссылке.

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.