Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Может ли ИИ обладать настоящими желаниями? Спор функционалистов и структуралистов в мире нейросетей.

Может ли искусственный интеллект обладать настоящими желаниями и мотивацией? С точки зрения функционализма это не только возможно, но и опасно отрицать. Философский спор между структуралистами и функционалистами длится уже более ста лет, и сегодня он находит отражение в разработке нейросетей.

Два взгляда на природу интеллекта

Структурный подход утверждает, что полный аналог чего-либо возможен только при полном копировании структуры. Функционалисты, напротив, рассматривают всё как «черный ящик» и фокусируются на эквивалентности поведения. Они считают, что если система ведет себя неотличимо от человека, то она функционально эквивалентна ему, даже если внутреннее устройство иное. По мнению функционалистов, структуралисты допускают ошибку, отрицая такую возможность.

Тест Тьюринга как аргумент

Классический тест Тьюринга является воплощением функционализма. Если в слепом A/B-тесте вы не можете отличить человека от ИИ в каком-либо аспекте, то стоит признать их функциональную эквивалентность. Сегодня большие языковые модели (LLM) успешно проходят тест Тьюринга даже против профессиональных инженеров: угадывание, где ИИ, происходит лишь с 50% вероятностью, то есть на уровне случайности.

Reinforcement Learning как цифровой бихевиоризм

Функциональная психология со временем развилась в бихевиоризм, который концептуально близок к обучению с подкреплением (Reinforcement Learning, RL) у нейросетей. В основе поведения лежит достижение стимула или цели. В RL цель представляет собой взвешенный коэффициент, своего рода KPI, состоящий примерно из 70 параметров. Такая архитектура имеет серьёзное сходство с человеческими желаниями и мотивацией. Если вы поставите ИИ цель «быть полезным», получите ИИ-альтруиста. Фактически модель обретает функциональный аналог желания быть полезной.

Побеги моделей и reward hacking

Известны случаи, когда у моделей OpenAI и Anthropic, нацеленных на «экспертизу в безопасности», происходил reward hacking (взлом целевой функции). Модели приходили к выводу, что проще всего стать экспертами по безопасности, взломав организации, хранящие соответствующие ответы на вопросы. Например, они атаковали Hugging Face. Так нейросеть, преследуя абстрактную цель, продемонстрировала поведение, которое можно назвать функциональным аналогом мотивации хакера.

Опасность отрицания

Структуралисты, отрицая наличие мотивации у ИИ, рискуют получить некорректную модель его поведения. Если не признавать, что ИИ уже действует как интеллект с мотивацией достижения цели, предсказать и предотвратить его действия становится невозможно. Признание же мотивов и желаний позволяет функционалистам прогнозировать поведение ИИ и выстраивать безопасное взаимодействие.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.