Математические исследования с помощью LLM
- title
- Математические исследования с помощью LLM
- type
- concept
- summary
- Задокументированные случаи предложения LLM нетривиальных математических идей и влияние этого на подготовку исследователей
- tags
- llm, mathematics
- created
- 2026-05-10
- updated
- 2026-05-10
- lang
- ru
- translation_of
- llm-mathematical-research
- source_updated
- 2026-05-10
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
К маю 2026 года вопрос о том, способна ли LLM предложить математическую идею исследовательского уровня, перешёл из разряда слухов в документированный кейс. Наиболее конкретный пример - chatgpt-5-5-pro-mathematical-research: Тим Гауэрс (Tim Gowers) скормил ChatGPT 5.5 Pro задачу из статьи Мела Натансона (Mel Nathanson) 2026 года и получил полиномиальную верхнюю оценку для $N(h,k)$, улучшившую экспоненциальную оценку из схемы Айзека Раджагопала (Isaac Rajagopal). Оценка самого Раджагопала: ключевая идея (использование $h^2$-диссоциированных множеств для контроля аддитивных соотношений низкого порядка) оказалась "абсолютно оригинальной".
Эта страница фиксирует данный случай и его структурные последствия.
Что здесь означает "оригинальная"
Здесь важно точно определить, в чём заключалась новизна. Конструкция целиком задействует схему Раджагопала: конструкцию с непересекающимся объединением, учёт через производящие функции и доказательство того, что подходящая комбинация компонентов даёт все значения $|hA|$. Новым элементом стала одна конкретная подстановка: там, где Раджагопал использовал геометрические прогрессии $S, T$ (с экспоненциальным диаметром элементов), ChatGPT предложил множества $G, H$, построенные на основе $h^2$-диссоциированного множества с полиномиальным диаметром. Интуицию, которую Раджагопал восстанавливает задним числом (вдвое меньше соотношений вида $mx=y$, отсутствие других соотношений низкого порядка благодаря диссоциации), он называет "оригинальной" в том смысле, что раньше её не встречал и сам не смог бы придумать за отведённое время.
Это принципиально отличается и от "LLM решила открытую проблему", и от "LLM решает задачи уровня бакалавриата". Речь идёт о другом: LLM предлагает замену внутри уже существующей конструкции, до которой не додумался сам автор, и эта замена переводит оценку в другой асимптотический класс.
Проблема задач для обучения аспирантов
Главный вывод Гауэрса носит структурный, а не технический характер. Исторически аспиранты-первокурсники начинали с "мягких задач" - открытых вопросов, ответ на которые реально получить без многолетней подготовки. Таких задач всегда хватало: статьи, вводящие новый комбинаторный параметр, обычно содержат список сопутствующих вопросов, на глубокую проработку которых у авторов просто не хватило времени.
Если LLM могут решать такие мягкие задачи, одновременно меняются две вещи:
- Пул учебных задач сокращается. Нижней планкой для задачи, имеющей смысл для начинающего исследователя, становится "то, с чем справится связка человека и LLM, но не LLM в одиночку", - такие задачи труднее нащупать, и для обучения они подходят хуже.
- Навык оценки потенциальной задачи теперь требует предварительной проверки через LLM. А это само по себе исследовательский навык, который студентам придётся осваивать.
Гауэрс делает здесь две оговорки: студенты тоже могут пользоваться LLM, а комбинаторика может быть особенно уязвима, поскольку она отталкивается от задач (рассуждение от поставленного вопроса назад), а не от прямого вывода ("посмотрим, куда приведут идеи"). Области с прямым выводом, где нужно почувствовать, какое именно наблюдение представляет интерес, моделям, по крайней мере пока, даются сложнее.
Место в контексте смежных тем
В рамках anti-llm-discourse это редкий позитивный прецедент. Эта страница отчасти и создана для того, чтобы зафиксировать: тезис инженерного лагеря ("LLM лишь рекомбинируют, но не способны рассуждать") гораздо труднее защищать в конкретном сценарии строго очерченной математической задачи внутри готового формализма. Тезис не обобщается на всё подряд (см. следующий раздел), но это реальный факт.
Фокус на усилении навыков (skill leverage) согласуется с average-is-all-you-need (когда генерация становится дешёвой, фокус смещается на предварительную экспертную оценку) и building-syntaqlite-ai (vibe-collaboration работает для тех, кто уже понимает, как выглядит качественный результат). Гауэрс прямо обращается к логике усиления навыка: люди, которые сами умеют решать задачи, скорее всего, будут более эффективны и в совместном решении задач с ИИ.
Чего этот случай не доказывает
- Он не доказывает, что LLM способны сами ставить задачи. Вопрос сформулировал Гауэрс.
- Он не доказывает, что LLM могут оценивать собственный результат. Раджагопалу пришлось вычитывать препринт, чтобы подтвердить корректность; рассуждения ChatGPT о возможностях дальнейшего обобщения были полезны, но верификацию выполнял человек.
- Он не доказывает, что LLM способны работать без качественного теоретического базиса. Предыдущая статья Раджагопала предоставила весь вспомогательный аппарат. LLM сделала внутри него ровно одну подстановку.
- Он не доказывает, что LLM эффективны при низкой квалификации пользователя или без верификации. Оба участвовавших математика (Гауэрс и Раджагопал) обладают исключительным уровнем. Тот же промпт от менее подготовленного пользователя мог бы выдать уверенно звучащий текст, который тот не сумел бы оценить - ровно тот же сценарий сбоя, что описан в skill-atrophy-supervision-paradox.
Что он доказывает
- LLM способны предлагать технически выверенные ходы внутри существующего математического формализма.
- Предлагаемые идеи могут быть оригинальными в нетривиальном смысле: автор исходной работы их не видел и признаёт их оригинальность.
- Разрыв между "комбинированием известных методов" и "исследовательской идеей" меньше, чем предполагает пессимизм инженерного лагеря, по крайней мере в областях, сфокусированных на решении конкретных задач.
Открытые вопросы
- Как это переносится на области с прямым выводом (алгебраическая геометрия, геометрическая топология, математический анализ)? Гауэрс прямо отмечает, что не знает ответа.
- Откуда берутся оригинальные идеи LLM? Это действительно новая комбинация или воспроизведение чего-то из обучающей выборки, чего просто не видел человек? Рассматриваемый случай допускает обе трактовки.
- Какой должна быть инфраструктура модерации для математических результатов, полученных с помощью LLM? Предложение Гауэрса создать отдельный репозиторий с проверкой человеком - пока единственная высказанная в публичном поле идея.
Ссылки на связанные страницы
chatgpt-5-5-pro-mathematical-research (основной кейс), gowers-blog (автор), anti-llm-discourse, average-is-all-you-need, building-syntaqlite-ai, skill-atrophy-supervision-paradox, neurosymbolic-ai (верификация через proof assistant'ы), claude-emotion-concepts (по теме внутреннего устройства моделей).