Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Флагманские ИИ-модели штурмуют IQ-тест Mensa: Claude-5.1 Fable от Anthropic набрала 151 балл!

Рекордсмены Mensa Norway

TrackingAI опубликовал свежие замеры интеллектуальных способностей ИИ-моделей на тесте Mensa Norway. Это тест из 35 визуальных задач для оценки IQ моделей.

В человеческой популяции средний IQ принят за 100 баллов, а для вступления в Mensa нужно попасть в верхние 2% по стандартизированному тесту. При стандартном отклонении 15 это IQ от 130 баллов. На шкале TrackingAI передовые ИИ-модели находятся в диапазоне примерно от 140 до 151 балла.

Лидеры рейтинга

Абсолютный рекорд установила Claude-5.1 Fable от Anthropic, набравшая 151 балл. Мультимодальная версия Claude-5.1 Fable (Vision) набрала 145 баллов.

Сразу несколько моделей остановились на 145 баллах:

  • GPT 6 Astra Ultra
  • GPT 5.6 LUNA Max
  • GPT 5.6 SOL Ultra

Вплотную к лидерам подобрались модели других разработчиков. Grok 4.6 High от xAI и Gemini 3.1 Pro от Google показали результат 144 балла, а Gemini 3.7 Flash набрала 143 балла. Следом идут сильные конкуренты из Китая:

  • Qwen 3.8 Max взяла планку 142 балла;
  • Kimi-K3-Vision показала 139 баллов.

Для сравнения, поисковые интерфейсы и модели без глубокого reasoning-контура показали более скромные цифры. Perplexity набрала 97 баллов, Bing Copilot получил 94 балла, а Mistral Large 3 остановилась на 88 баллах.

Почему 150 баллов пока не означают «приход AGI»

Красивые графики легко принять за доказательство «превосходства» ИИ над человеческим разумом, но авторы проекта и независимые эксперты призывают относиться к рекордам со здоровым скепсисом.

На итоговые баллы влияют фундаментальные ограничения:

  • Загрязнение обучающей выборки. Задания Mensa Norway и их разборы давно доступны публично в интернете, поэтому нельзя исключить, что часть этой информации могла присутствовать в обучающих данных современных ИИ-моделей.
  • Проверка закрытым тестом. TrackingAI отдельно использует набор новых задач, созданных участником Mensa специально для проекта. По утверждению TrackingAI, эти задания не были публично доступны для индексации и не должны были попасть в обучающие данные ИИ. На этом наборе многие флагманские модели показывают более низкие результаты, чем на публичном Mensa Norway.
  • Узкая специализация задач. Mensa Norway представляет собой матричный тест на распознавание закономерностей и абстрактное рассуждение. Он проверяет определённый класс способностей, но не измеряет напрямую весь спектр возможностей современной ИИ-системы: долгосрочное планирование, автономное выполнение многоэтапных задач, работу с инструментами и изменяющейся средой, проверку собственных гипотез и практическую надёжность.

Борьба между Anthropic, OpenAI и Google в районе 145-150 баллов наглядно подтверждает прогресс ИИ-моделей в IQ-тестах за последние годы.

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.