EnglishРусский Map
Cross-model code review

Об ограничениях самопроверки LLM в задачах рассуждения и планирования

title
Об ограничениях самопроверки LLM в задачах рассуждения и планирования
type
summary
summary
Стекли, Валмикам и Камбхампати выяснили: циклы самокритики GPT-4 снижают точность, а надёжный верификатор повышает её даже без текста критики
tags
llm, llm-evaluation, verification
created
2026-09-13
updated
2026-09-13
lang
ru
source_updated
2026-09-13
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Препринт исследователей из Университета штата Аризона Каи Стекли, Картики Валмикама и Суббарао Камбхампати (опубликован в феврале 2024 года, обновлён в августе 2024-го) проверяет популярное тогда убеждение: якобы LLM может улучшать собственные ответы, критикуя их в цикле. Авторы возводят эту веру к интуиции из теории сложности, согласно которой проверить решение легче, чем найти его, и показывают, что у этой интуиции нет оснований работать для модели, чьё поведение ближе к приближённому извлечению (approximate retrieval), чем к поиску.

Схема эксперимента

В качестве модели взят GPT-4. Домены выбраны так, чтобы корректность можно было проверить формально, новые задачи генерировались автоматически, а пространство решений нельзя было сократить сопоставлением с образцом: Game of 24, раскраска графов на 100 сгенерированных планарных графах, а также STRIPS-планирование в Blocksworld и его замаскированном аналоге Mystery Blocksworld. В каждом домене используется по 100 задач.

Система с самокритикой (LLM+LLM) отправляет prompt на генерацию, оборачивает ответ в prompt для верификации и отправляет той же модели, а если модель бракует свой ответ, добавляет критику и всю историю предыдущих попыток в следующий prompt. Цикл выполняется вплоть до 15 раундов. Рядом с ним тестируются две абляции. В связке LLM+sound verifier каждый ответ оценивает внешний верификатор (SymPy для Game of 24, простой цикл for по рёбрам для раскраски, VAL для планов) на трёх уровнях обратной связи: только pass/fail, первая ошибка или все ошибки. В режиме сэмплирования критика убирается вовсе, и тот же базовый prompt отправляется повторно, пока верификатор не примет ответ.

Результаты

Самокритика ухудшила результаты. В большинстве доменов итог цикла оказался хуже первой догадки самой модели, а увеличение числа раундов только ухудшало качество. Основной причиной стали ложноотрицательные срабатывания (false negatives): модель отвергала правильные ответы так часто, что система переходила к последующим, более слабым вариантам и упиралась в лимит попыток. Исключением стал Blocksworld со скромным приростом, который, впрочем, всё равно сильно уступал надёжному верификатору.

Сами тексты критики были ненадёжными. При раскраске графов они ссылались на несуществующие рёбра и неверно указывали цвета вершин. В планировании они галлюцинировали о выполнении предусловий действий. В Game of 24 среди выражений, заведомо равных 24, GPT-4 пометил как верные 79.1%, хотя само вычисление дало 24 в 81.6% случаев - то есть модель правильно вычисляла результат выражения, но всё равно отвергала его. Таблицы в приложении для Blocksworld показывают разрыв между обнаружением проблемы и её объяснением: на планах с невыполнимым шагом бинарный вердикт оказался верным в 70 случаях из 100, но само объяснение ошибки сошлось лишь в 8 случаях; на случайных планах ошибка была замечена во всех 100%, но верное объяснение содержалось только в 2 критиках.

С надёжным верификатором точность заметно выросла во всех доменах. Объём обратной связи почти не имел значения, а в двух доменах более подробный feedback даже немного снизил показатели. Повторная отправка неизменного prompt'а до тех пор, пока верификатор не примет ответ, сохранила большую часть прироста, и поскольку в prompt не включается история, расход токенов, по выражению авторов, оказывается квадратично ниже. Базовый вариант с self-consistency (выбор большинства из 15 ответов) не дал улучшений по сравнению с одиночным prompt'ом. Вывод авторов: LLM полезна как генератор гипотез, а успехи, которые в более ранних работах приписывались самокритике, в основном объясняются перебором множества попыток при наличии надёжной проверки.

Два результата из приложения очерчивают границы выводов. Добавление chain-of-thought при верификации подняло точность проверки в Game of 24 с 87% до 99%, однако полный цикл всё равно отстал от внешнего верификатора на 6 процентных пунктов, а расход выходных токенов вырос в 17 раз. А на тестовом наборе Tree of Thoughts 150 простых запросов с надёжным верификатором достигли 70% против 74%, заявленных авторами ToT.

При конвертации в HTML в vault не попали основные таблицы точности (таблицы 1 и 2), поэтому точные показатели по отдельным условиям, а также доли false positive и false negative из этих файлов восстановить нельзя. Приведённые выше цифры взяты из текста статьи или уцелевших таблиц.

Ограничения

Исследование проводилось на GPT-4 образца 2023-2024 годов на головоломках и задачах планирования, без участия программного кода. Но ещё важнее для цитирования статьи то, что в ней сравнивается самокритика модели с заведомо корректным внешним верификатором. В роль проверяющего ни разу не ставилась вторая, другая LLM, поэтому работа ничего напрямую не говорит о том, справилась бы другая модель лучше, чем сама генерирующая модель. Она показывает лишь то, что ненадёжный верификатор отравляет цикл, а надёжный - чинит его.

Связанные страницы

  • cross-model-code-review - место этой статьи среди других исследований о том, кто чьи результаты должен проверять
  • reviewer-capability-rejection-targeting - пилотное исследование 2026 года, обнаружившее такое же избыточное отклонение вариантов при самопроверке с добавлением рецензента из другого семейства моделей
  • neurosymbolic-ai - паттерн LLM-Modulo, в пользу которого выступает эта статья: модель предлагает варианты, символьный верификатор принимает решение
  • testing-heavy-no-review-workflow - подход в разработке ПО, где предпочтение отдаётся строгой проверке тестами, а не рецензированию
  • llm-critics-are-right-use-anyway - Теохарис об обучении вместе с LLM только в условиях наличия строгой проверки