Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Почему нейросети не смогли притвориться двоечниками по алгебре?

Мы обратили внимание на эксперимент исследователей из Университета Дрекселя: они попытались заставить языковые модели изображать школьников с разным уровнем знаний по алгебре. Однако одной инструкции «отвечай как слабый ученик» для реальной роли двоечника оказалось недостаточно.

Gemini 3.1 Flash Lite, Claude Haiku 4.5 и GPT-5.4-mini получили 379 заданий по алгебре и пять разных ролей учеников, но с задачей не справились. Независимо от того, была ли модель «отличником» или «двоечником», точность оставалась на уровне от 96,8 до 100%.

Проблема в том, что модель уже знает правильное решение и с трудом подавляет собственные способности. Поэтому авторы разделили задачу на две части: сначала отдельный алгоритм моделирует, что ученик знает и где ошибается, а затем LLM формулирует объяснение его ответа. Так удалось получить более правдоподобную градацию: точность «почти эксперта» составила 85,2%, среднего ученика 57,8%, а слабого 44,1%.

Авторы признают, что еще не сравнивали виртуальных «школьников» с реальными учениками. Поэтому пока речь идет скорее о способе научить ИИ правдоподобно ошибаться, чем о точной модели человеческого обучения.

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.