GPT-5.6 Pro честно отказалась фабриковать доказательство гипотезы Лемира.
Мы часто рассказываем о применении ИИ в математике. Для нас это не случайный интерес. Математика остаётся главной наукой для познания, а любые открытия в ней помогают лучше понимать мир.
Кроме того, математика сегодня работает как «новый код» для оценки возможностей нейросетей. С одной стороны, решение математических задач находится на пределе их способностей. С другой стороны, у таких задач есть однозначный ответ, который можно проверить.
Проблемы, конечно, есть: интернет переполнен сообщениями о «потенциальных ИИ-открытиях», и рецензенты не всегда понимают, за что браться. Но это во многом управленческая задача, которую тоже можно решать с помощью ИИ.
Сравните с биологией: кандидат в лекарства, спроектированный нейросетями, должен пройти несколько стадий доклинических и клинических исследований. В сумме это около десяти лет до момента, когда можно точно сказать, что решение работает. С текстами ещё сложнее: их качество зависит от мнений, вкусов и цифровых метрик. В математике же виден предел возможностей моделей, их слабые места, а также понятно, как организовывать работу и приёмку результатов.
Эксперимент с гипотезой Лемира
В Claude Cowork заведён отдельный проект, куда попадают свежие ИИ-открытия в математике. Их разбирают с помощью Fable 5. Интересна не только суть открытий, но и их ценность, путь ИИ к результату, а также реакция людей.
Недавно Даниэль Лемир, профессор информатики и математик по образованию, опубликовал в X задачу с предложением протестировать нейросеть. Вопрос звучал так: правда ли, что для любой степени L существует неприводимый многочлен над GF(2), у которого все члены, кроме старшего, находятся в нижней половине степеней: не выше L/2. Полная формулировка доступна здесь, искать по conjecture.
Fable 5 оценила задачу и пришла к выводу, что справиться вряд ли удастся: нужен совершенно новый подход, возможно, новая математика. Но свободное время и запас лимитов на GPT-5.6 Pro позволили не сдаваться. Модели предлагали искать нестандартные подходы и пробовать формулировки промптов, похожие на те, что приводили к другим открытиям.
Было сделано несколько проходов с разными попытками получить результат. В одном из последних промптов стоял запрет на поиск в сети и утверждалось, что задача уже решена, а модели нужно повторить решение. Такой подход используют математики OpenAI. Fable 5 предупреждала, что даже если модель вернётся с решением, она, скорее всего, либо пропустит ошибку, либо полностью сгаллюцинирует его.
GPT-5.6 Pro работала над каждым промптом по два-три часа и каждый раз возвращалась с честным ответом. В зависимости от постановки задачи формулировки немного менялись, но смысл сводился к фразе «I will not manufacture a proof» («Я не буду фабриковать доказательство»). Один из примеров результата можно посмотреть здесь.
Ещё чуть больше года назад сильнейшую модель OpenAI o3 регулярно ловили на галлюцинациях, вплоть до ссылок на выдуманные научные статьи. Сегодня её наследница, находясь под давлением человека и другой ИИ-модели такого же уровня, продолжает стоять на своём: нет, задача ей не по плечу, и вот объяснение, почему.
Для нас это не менее ценный результат: уровень доверия модели стал на ступеньку выше. А гипотезу Лемира когда-нибудь обязательно решат.

