Недавний опыт работы с ChatGPT 5.5 Pro (Гауэрс)
- title
- Недавний опыт работы с ChatGPT 5.5 Pro (Гауэрс)
- type
- summary
- summary
- Тим Гауэрс: ChatGPT 5.5 Pro менее чем за два часа получил оригинальный результат уровня PhD в аддитивной комбинаторике без подсказок
- tags
- llm, mathematics, case-study
- created
- 2026-05-10
- updated
- 2026-05-10
- lang
- ru
- translation_of
- chatgpt-5-5-pro-mathematical-research
- source_updated
- 2026-05-10
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Тим Гауэрс - лауреат Филдсовской премии, специалист по комбинаторике - рассказывает, как предложил ChatGPT 5.5 Pro задачу из статьи Мела Натансона 2026 года Diversity, Equity and Inclusion for Problems in Additive Number Theory. Менее чем за два часа работы модели, распределённых по нескольким промптам, LLM получила полиномиальную верхнюю оценку для $N(h,k)$ - минимального $N$, при котором все размеры множеств сумм в $\mathcal{R}(h,k)$ достижимы с помощью $k$-элементных подмножеств ${0, \dots, N}$, - улучшив прежнюю экспоненциальную оценку Айзека Раджагопала до $O(k^{10h^3})$.
Раджагопал, студент MIT и автор исходного фреймворка, написал гостевой раздел с оценкой результата. Его вердикт: "Насколько я могу судить, эта идея абсолютно оригинальна".
В контексте anti-llm-discourse это важно от обратного: пример выбивается из общего ряда как позитивный кейс. Гауэрс отдельно подчёркивает слова Раджагопала о том, что доказательство "выглядело корректным не просто построчно, а на уровне самих идей".
Что именно сделала модель
Три последовательных раунда:
- Случай $h=2$. ChatGPT думал 17 минут, выдал квадратичную верхнюю оценку (наилучшую из возможных) и за 2 минуты оформил её в виде препринта в LaTeX. В чём трюк: заменить множество Сидона из степеней двойки у Натансона на известное эффективное множество квадратичного диаметра.
- Ограниченная сумма множеств. Тот же приём, никаких сложностей.
- Общий случай $h$. Усиление аргумента Раджагопала. Оценку удалось улучшить с экспоненциальной по $k$ сначала до экспоненциальной по $k^{1/2+\varepsilon}$ (16:41), а затем до полиномиальной по $k$ (13:33 + 9:12 на проверку + 31:40 на оформление текста). Раджагопал переслал препринт и отметил, что полиномиальная оценка "почти наверняка верна" на уровне идей.
Оригинальная идея
В своей прежней работе Раджагопал строил множества $A$ как комбинации двух геометрических прогрессий $S = {0, 1, m, \dots, m^{\ell-2}}$ и $T = {1, m, \dots, m^{\ell-1}}$. Каждое из них является $B_h$-множеством (множеством, у которого размер $h$-кратной суммы достигает максимума $\binom{h+\ell-1}{h}$) либо отличается от него на структурно контролируемый дефицит. Но элементы $S$ и $T$ экспоненциально велики, из-за чего и оценка на $N(h,k)$ в этой конструкции получалась экспоненциальной.
Раджагопал через Гауэрса поинтересовался, могут ли множества $G, H$ с элементами полиномиального размера воспроизвести $B_h$-структуру множеств $S, T$. Сам он этого не знал. ChatGPT предложил конструкцию:
$$G = {0, u_1, \dots, u_r, m u_1, \dots, m u_r}, \quad H = {u_1, \dots, u_r, m u_1, \dots, m u_r}$$
где ${u_1, \dots, u_r}$ - $h^2$-диссоциированное множество (без нетривиальных аддитивных соотношений между $\leq h^2$ элементами), построенное методами конечных полей (в духе Боуза - Чоулы, 1963). Диаметр элементов: полиномиальный от $r$.
Интуиция Раджагопала постфактум: $S, T$ содержат порядка $\ell$ соотношений вида $mx = y$; $G, H$ содержат порядка $\ell/2$. При этом $h^2$-диссоциация исключает все прочие соотношения низкого порядка. В итоге $G, H$ сохраняют в точности нужную аддитивную структуру $S, T$, но сжимают диаметр с экспоненциального до полиномиального. Именно идею использовать $h^2$-диссоциированные множества для контроля соотношений порядка $\leq h$ Раджагопал и называет оригинальной.
Подстановка $G, H$ вместо $S, T$ в остальную часть конструкции Раджагопала даёт $N(h,k) \leq O(k^{10h^3})$.
Взгляд Гауэрса
Эквивалент "вполне достойной главы в кандидатской диссертации по комбинаторике". Ничего сверхъестественного, опирается на работу Раджагопала, но полученное обобщение - нетривиальный вклад, на который у начинающего аспиранта ушли бы недели: прочесть статью Раджагопала, найти неоптимальные места, разобраться в алгебраических методах.
Главный вывод, определяющий дальнейший тон поста: планка задач для начинающего аспиранта только что выросла. "Мягкие задачи", на которых исторически вводили в курс дела молодых математиков, теперь по зубам LLM. Нижняя граница осмысленного научного вклада теперь звучит так: доказать в связке с LLM нечто такое, с чем LLM не способна справиться в одиночку.
Гауэрс делает две оговорки:
- Аспиранты тоже могут использовать LLM. Планка заключается не в том, "чего не умеют LLM", а в том, "что связка LLM и человека может сделать такого, чего LLM не способна сделать одна".
- Он не знает, как этот опыт переносится за пределы комбинаторики. Комбинаторика движима конкретными задачами (рассуждение идёт от вопроса назад). Области, где рассуждение строится вперёд ("какое наблюдение представляет интерес?"), пока могут быть не столь уязвимы.
Где публиковать подобные результаты
Гауэрс отвергает как ярлык "AI slop", так и "публикацию в академическом журнале". Его предложение: модерируемый репозиторий ИИ-результатов. Модерация через верификацию математиками-людьми, в идеале - с проверкой в интерактивных доказателях теорем (proof assistants) и в идеале - как ответ на уже сформулированный в литературе вопрос. Нагрузка на модераторов остаётся открытой проблемой; при этом он предостерегает от ИИ-модерации по очевидным рекурсивным причинам.
"Если бы этот результат получил математик-человек, его бы гарантированно опубликовали, поэтому называть его AI slop, на мой взгляд, было бы неправильно".
Что это значит для математики как профессии
Мысленный эксперимент от Гауэрса: математик решает крупную проблему в ходе длительного диалога с LLM, где человек лишь направляет, а основные идеи генерирует модель. Будем ли мы считать это крупным достижением самого математика? "Не думаю".
Зачем тогда вообще этим заниматься? Его ответ: решение сложных задач даёт понимание самого процесса поиска решений, а именно это и делает человека эффективным в совместной работе с ИИ. Те, кто сам решал задачи, скорее всего, лучше чувствуют контекст при совместной работе с LLM - подобно тому, как опытный счетовод сразу замечает, если калькулятор выдал явную нелепицу. Наградой становится уже не бессмертие благодаря доказанной теореме, а устойчивый навык вовремя распознавать, где ответ, полученный с помощью LLM, выглядит подозрительно.
Та же мысль, что и в average-is-all-you-need (когда генерация результата обесценивается, внимание смещается на экспертную оценку на входе, которая остаётся дефицитной). То же направление, что и в building-syntaqlite-ai (vibe-кодинг не работает у тех, кто сам не понимает, как выглядит качественный результат). Следствие: высококлассные специалисты получают от LLM гораздо больший рычаг, тогда как те, для кого LLM якобы должны были "демократизировать" науку, получают куда меньше, чем обещают громкие заголовки.
Место в ряду анти-LLM дискурса
Этот текст как раз восполняет пробел, о котором говорится в anti-llm-discourse: "серьёзный технический анализ того, какие условия должны выполняться, чтобы разработка с помощью LLM работала хорошо". У Гауэрса аналогом выступает не разработка, а исследовательская математика. Он приводит тот самый недостающий позитивный пример, подкреплённый оригинальной идеей, которую подтвердил сам Раджагопал.
Это не опровергает инженерные претензии из no-silver-bullet-llms или peril-of-laziness-lost: там речь идёт о том, что LLM раздувают кодовые базы при долгой поддержке, а не о том, что LLM предлагает одну удачную идею за два часа. Другая область, другой характер сбоев.
Но это ставит под сомнение пессимизм из building-syntaqlite-ai и i-will-never-use-ai. Если LLM способна выдать "оригинальную и остроумную" математическую идею - что подтвердил автор расширяемого фреймворка, - сильную позицию о том, что "LLM не умеют рассуждать, а лишь перекомбинируют", в данном случае защищать сложнее. Сам Гауэрс замечает: "изрядная часть вполне качественной человеческой математики заключается в комбинировании уже известных знаний и методов доказательства". Граница между LLM и человеком оказывается куда более размытой, чем принято считать в публичных дискуссиях.
Ссылки
- Сущность автора: gowers-blog
- Концепция: llm-mathematical-research (разборы кейсов + структурные последствия для планки научных исследований)
- Контекст анти-LLM дискурса: anti-llm-discourse, i-am-an-ai-hater, i-will-never-use-ai, no-silver-bullet-llms
- Контекст рычага квалификации: average-is-all-you-need, building-syntaqlite-ai, skill-atrophy-supervision-paradox
- Смежные темы: claude-emotion-concepts (внутреннее устройство моделей), neurosymbolic-ai (ИИ + формальная верификация, к вопросу о предложении Гауэрса по модерации)