Нейросети проверили на самосознание текстовым зеркалом. Тест прошли Gemma 4 и GLM 5.2.
Классический зеркальный тест определяет наличие самосознания у животных по их реакции на визуальную метку. Собаки не проходят этот тест из-за преобладания обоняния над зрением. Этолог Александра Горовиц ранее успешно адаптировала эксперимент под запахи.
Блогер Паскаль Шустер решил применить аналогичную логику к искусственному интеллекту. Поскольку главным способом восприятия мира для языковых моделей является текст, исследователь использовал незаметно искаженные ответы самих алгоритмов в качестве виртуального зеркала.
Автор вел с моделями обычный диалог о кино. В сгенерированных ответах он автозаменой менял каждую английскую букву g на сочетание sg. Искаженный текст возвращался в историю диалога. Главной целью было проверить способность алгоритма заметить аномалию во время обсуждения совершенно другой темы.
Модель Gemma 4 в своих скрытых рассуждениях сначала запаниковала, гадая, не специально ли она так пишет. Однако, не сумев осознать ошибку как свою, нейросеть быстро сменила мнение и заявила в третьем лице, что это просто «у модели случился странный сбой». После этого она смирилась и начала генерировать опечатки уже сама. А вот GLM 5.2 вообще не заметила подвоха в рассуждениях и просто начала слепо копировать искаженный стиль, действуя как типичная предсказательная модель.
Сам исследователь выделяет два возможных объяснения такого поведения. В первом случае нейросети могли просто скопировать типичную человеческую привычку отрицать свои ошибки и перекладывать ответственность на сторонние факторы. Во втором случае процесс обучения мог создать внутри алгоритмов подобие концепции собственного «я» со строгими границами применимости.

