Флагманские ИИ-модели штурмуют IQ-тест Mensa: Claude-5.1 Fable от Anthropic набрала 151 балл!
Рекордсмены Mensa Norway
TrackingAI опубликовал свежие замеры интеллектуальных способностей ИИ-моделей на тесте Mensa Norway. Это тест из 35 визуальных задач для оценки IQ моделей.
В человеческой популяции средний IQ принят за 100 баллов, а для вступления в Mensa нужно попасть в верхние 2% по стандартизированному тесту. При стандартном отклонении 15 это IQ от 130 баллов. На шкале TrackingAI передовые ИИ-модели находятся в диапазоне примерно от 140 до 151 балла.
Лидеры рейтинга
Абсолютный рекорд установила Claude-5.1 Fable от Anthropic, набравшая 151 балл. Мультимодальная версия Claude-5.1 Fable (Vision) набрала 145 баллов.
Сразу несколько моделей остановились на 145 баллах:
- GPT 6 Astra Ultra
- GPT 5.6 LUNA Max
- GPT 5.6 SOL Ultra
Вплотную к лидерам подобрались модели других разработчиков. Grok 4.6 High от xAI и Gemini 3.1 Pro от Google показали результат 144 балла, а Gemini 3.7 Flash набрала 143 балла. Следом идут сильные конкуренты из Китая:
- Qwen 3.8 Max взяла планку 142 балла;
- Kimi-K3-Vision показала 139 баллов.
Для сравнения, поисковые интерфейсы и модели без глубокого reasoning-контура показали более скромные цифры. Perplexity набрала 97 баллов, Bing Copilot получил 94 балла, а Mistral Large 3 остановилась на 88 баллах.
Почему 150 баллов пока не означают «приход AGI»
Красивые графики легко принять за доказательство «превосходства» ИИ над человеческим разумом, но авторы проекта и независимые эксперты призывают относиться к рекордам со здоровым скепсисом.
На итоговые баллы влияют фундаментальные ограничения:
- Загрязнение обучающей выборки. Задания Mensa Norway и их разборы давно доступны публично в интернете, поэтому нельзя исключить, что часть этой информации могла присутствовать в обучающих данных современных ИИ-моделей.
- Проверка закрытым тестом. TrackingAI отдельно использует набор новых задач, созданных участником Mensa специально для проекта. По утверждению TrackingAI, эти задания не были публично доступны для индексации и не должны были попасть в обучающие данные ИИ. На этом наборе многие флагманские модели показывают более низкие результаты, чем на публичном Mensa Norway.
- Узкая специализация задач. Mensa Norway представляет собой матричный тест на распознавание закономерностей и абстрактное рассуждение. Он проверяет определённый класс способностей, но не измеряет напрямую весь спектр возможностей современной ИИ-системы: долгосрочное планирование, автономное выполнение многоэтапных задач, работу с инструментами и изменяющейся средой, проверку собственных гипотез и практическую надёжность.
Борьба между Anthropic, OpenAI и Google в районе 145-150 баллов наглядно подтверждает прогресс ИИ-моделей в IQ-тестах за последние годы.

