Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Нейросети проверили на самосознание текстовым зеркалом. Тест прошли Gemma 4 и GLM 5.2.

Классический зеркальный тест определяет наличие самосознания у животных по их реакции на визуальную метку. Собаки не проходят этот тест из-за преобладания обоняния над зрением. Этолог Александра Горовиц ранее успешно адаптировала эксперимент под запахи.

Блогер Паскаль Шустер решил применить аналогичную логику к искусственному интеллекту. Поскольку главным способом восприятия мира для языковых моделей является текст, исследователь использовал незаметно искаженные ответы самих алгоритмов в качестве виртуального зеркала.

Автор вел с моделями обычный диалог о кино. В сгенерированных ответах он автозаменой менял каждую английскую букву g на сочетание sg. Искаженный текст возвращался в историю диалога. Главной целью было проверить способность алгоритма заметить аномалию во время обсуждения совершенно другой темы.

Модель Gemma 4 в своих скрытых рассуждениях сначала запаниковала, гадая, не специально ли она так пишет. Однако, не сумев осознать ошибку как свою, нейросеть быстро сменила мнение и заявила в третьем лице, что это просто «у модели случился странный сбой». После этого она смирилась и начала генерировать опечатки уже сама. А вот GLM 5.2 вообще не заметила подвоха в рассуждениях и просто начала слепо копировать искаженный стиль, действуя как типичная предсказательная модель.

Сам исследователь выделяет два возможных объяснения такого поведения. В первом случае нейросети могли просто скопировать типичную человеческую привычку отрицать свои ошибки и перекладывать ответственность на сторонние факторы. Во втором случае процесс обучения мог создать внутри алгоритмов подобие концепции собственного «я» со строгими границами применимости.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.