Об ограничениях самопроверки LLM в задачах рассуждения и планирования
- title
- Об ограничениях самопроверки LLM в задачах рассуждения и планирования
- type
- summary
- summary
- Стекли, Валмикам и Камбхампати выяснили: циклы самокритики GPT-4 снижают точность, а надёжный верификатор повышает её даже без текста критики
- parent
- cross-model-code-review
- tags
- llm, llm-evaluation, verification
- created
- 2026-09-13
- updated
- 2026-09-13
- lang
- ru
- translation_of
- llm-self-verification-limits
- source_updated
- 2026-09-13
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Препринт исследователей из Университета штата Аризона Каи Стекли, Картики Валмикама и Суббарао Камбхампати (опубликован в феврале 2024 года, обновлён в августе 2024-го) проверяет популярное тогда убеждение: якобы LLM может улучшать собственные ответы, критикуя их в цикле. Авторы возводят эту веру к интуиции из теории сложности, согласно которой проверить решение легче, чем найти его, и показывают, что у этой интуиции нет оснований работать для модели, чьё поведение ближе к приближённому извлечению (approximate retrieval), чем к поиску.
Схема эксперимента
В качестве модели взят GPT-4. Домены выбраны так, чтобы корректность можно было проверить формально, новые задачи генерировались автоматически, а пространство решений нельзя было сократить сопоставлением с образцом: Game of 24, раскраска графов на 100 сгенерированных планарных графах, а также STRIPS-планирование в Blocksworld и его замаскированном аналоге Mystery Blocksworld. В каждом домене используется по 100 задач.
Система с самокритикой (LLM+LLM) отправляет prompt на генерацию, оборачивает ответ в prompt для верификации и отправляет той же модели, а если модель бракует свой ответ, добавляет критику и всю историю предыдущих попыток в следующий prompt. Цикл выполняется вплоть до 15 раундов. Рядом с ним тестируются две абляции. В связке LLM+sound verifier каждый ответ оценивает внешний верификатор (SymPy для Game of 24, простой цикл for по рёбрам для раскраски, VAL для планов) на трёх уровнях обратной связи: только pass/fail, первая ошибка или все ошибки. В режиме сэмплирования критика убирается вовсе, и тот же базовый prompt отправляется повторно, пока верификатор не примет ответ.
Результаты
Самокритика ухудшила результаты. В большинстве доменов итог цикла оказался хуже первой догадки самой модели, а увеличение числа раундов только ухудшало качество. Основной причиной стали ложноотрицательные срабатывания (false negatives): модель отвергала правильные ответы так часто, что система переходила к последующим, более слабым вариантам и упиралась в лимит попыток. Исключением стал Blocksworld со скромным приростом, который, впрочем, всё равно сильно уступал надёжному верификатору.
Сами тексты критики были ненадёжными. При раскраске графов они ссылались на несуществующие рёбра и неверно указывали цвета вершин. В планировании они галлюцинировали о выполнении предусловий действий. В Game of 24 среди выражений, заведомо равных 24, GPT-4 пометил как верные 79.1%, хотя само вычисление дало 24 в 81.6% случаев - то есть модель правильно вычисляла результат выражения, но всё равно отвергала его. Таблицы в приложении для Blocksworld показывают разрыв между обнаружением проблемы и её объяснением: на планах с невыполнимым шагом бинарный вердикт оказался верным в 70 случаях из 100, но само объяснение ошибки сошлось лишь в 8 случаях; на случайных планах ошибка была замечена во всех 100%, но верное объяснение содержалось только в 2 критиках.
С надёжным верификатором точность заметно выросла во всех доменах. Объём обратной связи почти не имел значения, а в двух доменах более подробный feedback даже немного снизил показатели. Повторная отправка неизменного prompt'а до тех пор, пока верификатор не примет ответ, сохранила большую часть прироста, и поскольку в prompt не включается история, расход токенов, по выражению авторов, оказывается квадратично ниже. Базовый вариант с self-consistency (выбор большинства из 15 ответов) не дал улучшений по сравнению с одиночным prompt'ом. Вывод авторов: LLM полезна как генератор гипотез, а успехи, которые в более ранних работах приписывались самокритике, в основном объясняются перебором множества попыток при наличии надёжной проверки.
Два результата из приложения очерчивают границы выводов. Добавление chain-of-thought при верификации подняло точность проверки в Game of 24 с 87% до 99%, однако полный цикл всё равно отстал от внешнего верификатора на 6 процентных пунктов, а расход выходных токенов вырос в 17 раз. А на тестовом наборе Tree of Thoughts 150 простых запросов с надёжным верификатором достигли 70% против 74%, заявленных авторами ToT.
При конвертации в HTML в vault не попали основные таблицы точности (таблицы 1 и 2), поэтому точные показатели по отдельным условиям, а также доли false positive и false negative из этих файлов восстановить нельзя. Приведённые выше цифры взяты из текста статьи или уцелевших таблиц.
Ограничения
Исследование проводилось на GPT-4 образца 2023-2024 годов на головоломках и задачах планирования, без участия программного кода. Но ещё важнее для цитирования статьи то, что в ней сравнивается самокритика модели с заведомо корректным внешним верификатором. В роль проверяющего ни разу не ставилась вторая, другая LLM, поэтому работа ничего напрямую не говорит о том, справилась бы другая модель лучше, чем сама генерирующая модель. Она показывает лишь то, что ненадёжный верификатор отравляет цикл, а надёжный - чинит его.
Связанные страницы
- cross-model-code-review - место этой статьи среди других исследований о том, кто чьи результаты должен проверять
- reviewer-capability-rejection-targeting - пилотное исследование 2026 года, обнаружившее такое же избыточное отклонение вариантов при самопроверке с добавлением рецензента из другого семейства моделей
- neurosymbolic-ai - паттерн LLM-Modulo, в пользу которого выступает эта статья: модель предлагает варианты, символьный верификатор принимает решение
- testing-heavy-no-review-workflow - подход в разработке ПО, где предпочтение отдаётся строгой проверке тестами, а не рецензированию
- llm-critics-are-right-use-anyway - Теохарис об обучении вместе с LLM только в условиях наличия строгой проверки