Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

GPT-5.6 Pro честно отказалась фабриковать доказательство гипотезы Лемира.

Мы часто рассказываем о применении ИИ в математике. Для нас это не случайный интерес. Математика остаётся главной наукой для познания, а любые открытия в ней помогают лучше понимать мир.

Кроме того, математика сегодня работает как «новый код» для оценки возможностей нейросетей. С одной стороны, решение математических задач находится на пределе их способностей. С другой стороны, у таких задач есть однозначный ответ, который можно проверить.

Проблемы, конечно, есть: интернет переполнен сообщениями о «потенциальных ИИ-открытиях», и рецензенты не всегда понимают, за что браться. Но это во многом управленческая задача, которую тоже можно решать с помощью ИИ.

Сравните с биологией: кандидат в лекарства, спроектированный нейросетями, должен пройти несколько стадий доклинических и клинических исследований. В сумме это около десяти лет до момента, когда можно точно сказать, что решение работает. С текстами ещё сложнее: их качество зависит от мнений, вкусов и цифровых метрик. В математике же виден предел возможностей моделей, их слабые места, а также понятно, как организовывать работу и приёмку результатов.

Эксперимент с гипотезой Лемира

В Claude Cowork заведён отдельный проект, куда попадают свежие ИИ-открытия в математике. Их разбирают с помощью Fable 5. Интересна не только суть открытий, но и их ценность, путь ИИ к результату, а также реакция людей.

Недавно Даниэль Лемир, профессор информатики и математик по образованию, опубликовал в X задачу с предложением протестировать нейросеть. Вопрос звучал так: правда ли, что для любой степени L существует неприводимый многочлен над GF(2), у которого все члены, кроме старшего, находятся в нижней половине степеней: не выше L/2. Полная формулировка доступна здесь, искать по conjecture.

Fable 5 оценила задачу и пришла к выводу, что справиться вряд ли удастся: нужен совершенно новый подход, возможно, новая математика. Но свободное время и запас лимитов на GPT-5.6 Pro позволили не сдаваться. Модели предлагали искать нестандартные подходы и пробовать формулировки промптов, похожие на те, что приводили к другим открытиям.

Было сделано несколько проходов с разными попытками получить результат. В одном из последних промптов стоял запрет на поиск в сети и утверждалось, что задача уже решена, а модели нужно повторить решение. Такой подход используют математики OpenAI. Fable 5 предупреждала, что даже если модель вернётся с решением, она, скорее всего, либо пропустит ошибку, либо полностью сгаллюцинирует его.

GPT-5.6 Pro работала над каждым промптом по два-три часа и каждый раз возвращалась с честным ответом. В зависимости от постановки задачи формулировки немного менялись, но смысл сводился к фразе «I will not manufacture a proof» («Я не буду фабриковать доказательство»). Один из примеров результата можно посмотреть здесь.

Ещё чуть больше года назад сильнейшую модель OpenAI o3 регулярно ловили на галлюцинациях, вплоть до ссылок на выдуманные научные статьи. Сегодня её наследница, находясь под давлением человека и другой ИИ-модели такого же уровня, продолжает стоять на своём: нет, задача ей не по плечу, и вот объяснение, почему.

Для нас это не менее ценный результат: уровень доверия модели стал на ступеньку выше. А гипотезу Лемира когда-нибудь обязательно решат.

Этот пост Вконтакте:

Ещё новости:

Open Bot: опенсорсная версия Grok Bot для рабочих задач!
Как прокачать GigaChat: внешняя база знаний, Qwen, DeepSeek и Structured Output.
MiniMax-Music3 Portable by Neurogen: портативное приложение для генерации музыки.
Grok лидирует в MedAgentBench, а MAST выводит вперёд GPT-5.6 Sol и Kimi K3: почему одной LLM мало.
ML-проект недели: определение глубины сцены в реальном времени в браузере.
Anthropic вышла на темп $65 млрд в год, но это не годовая выручка.
Нейросеть научилась добавлять виртуальный свет, который прячется за реальными объектами в видео.
Нейросети прошли тест Милгрэма: на каком ударе откажется модель?
Беспилотное такси Tesla протаранило дорожные заграждения: ИИ решил ехать напролом.
ИИ помог создать персонализированную мРНК-вакцину от меланомы: Moderna и Merck объявили об успехе испытаний.