Variation in Verification: понимание динамики верификации в LLM
- title
- Variation in Verification: понимание динамики верификации в LLM
- type
- summary
- summary
- Исследование Salesforce: ошибки сильных генераторов сложнее отловить верификатору; связка слабого генератора и GPT-4o почти догоняет сильный
- parent
- cross-model-code-review
- tags
- llm, llm-evaluation, verification, benchmarks
- created
- 2026-09-13
- updated
- 2026-09-13
- lang
- ru
- translation_of
- verification-dynamics-llms
- source_updated
- 2026-09-13
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Исследование Yefan Zhou, Austin Xu, Yilun Zhou, Janvijay Singh, Jiang Gui и Shafiq Joty (Salesforce AI Research, совместно с Dartmouth и UIUC), впервые опубликованное в сентябре 2025 года и обновлённое в апреле 2026 года. Работа ставит под сомнение распространённую практику выбирать в качестве верификатора передовую модель по умолчанию - в предположении, что качество верификации масштабируется вместе со способностью самого верификатора решать задачу. Авторы выясняют, что ещё определяет точность верификатора.
Постановка эксперимента
Верификаторы работают в генеративном режиме: модель формирует цепочку рассуждений (chain of thought) и завершает её вердиктом Correct или Incorrect без эталонного ответа. Четырнадцать открытых моделей размером от 2B до 72B (Qwen2.5, Qwen3, Llama 3.x, Gemma-2, Ministral и Mistral-Small), а также GPT-4o выступают одновременно в роли генератора и верификатора. Задачи взяты из 12 бенчмарков с объективными ответами: 2347 математических задач (подмножество GSM8K, MATH500, OlympiadBench, AIME24/25, AMC23, Minerva-Math, многошаговая арифметика BBEH), 1196 вопросов из MMLU-Pro и 901 задача на логическое рассуждение на естественном языке (ReClor, FOLIO, GPQA Diamond). Каждая модель генерирует по 64 сэмпла на задачу. Сложность задачи определяется как средний pass rate по всем генераторам. Качество верификаторов оценивается по true positive rate (принятие верных ответов) и true negative rate (отклонение неверных).
Три результата
Сложность задачи главным образом определяет, будут ли приняты правильные ответы. True positive rate стабильно растёт по мере упрощения задач, тогда как в true negative rate явного тренда нет. Механизм здесь в том, что верификаторы склонны перерешивать задачу заново и сравнивать ответы; на сложных задачах их собственное решение чаще оказывается ошибочным, и 39.1% ложноотрицательных срабатываний (false negatives) на сложном наборе содержат ошибку в эталонном ответе самого верификатора.
Способности генератора главным образом определяют, удастся ли отловить ошибки. По мере усиления генератора true negative rate заметно падает почти для всех верификаторов и предметных областей. Qwen2.5-72B в роли математического верификатора отклоняет 68% неверных ответов Llama-3.1-8B и лишь 17% неверных ответов Qwen3-32B. Слабые генераторы допускают поверхностные ошибки вроде самопротиворечий, которые верификаторы легко отсекают; сильные же генераторы выдают внутренне согласованные цепочки, где ранняя ошибка (например, упущенный частный случай) аккуратно транслируется в хорошо структурированный неверный ответ. Прогон с LLM-as-judge по выводам генераторов подтверждает, что поверхностные ошибки встречаются тем реже, чем выше способности модели.
Способности верификатора в целом коррелируют с точностью верификации, однако характер этой связи зависит от сложности. На задачах средней сложности зависимость близка к линейной (r выше 0.9). На простых задачах возникает порог насыщения ближе к верхнему краю диапазона возможностей. На сложных задачах рост способностей почти не помогает: в математике сбалансированная точность выходит на плато в районе 0.65, а в сложных рассуждениях на естественном языке верификаторы показывают результат хуже случайного угадывания без какой-либо значимой зависимости вообще. Отмечается, что выводы остаются в силе для reasoning-моделей, для Qwen3-235B и при разных промптах верификации.
Test-time scaling
В прикладной части 64 сэмпла фильтруются через верификатор, после чего измеряется pass rate отфильтрованных ответов. При использовании GPT-4o в качестве фиксированного верификатора на 181 математической задаче со сложностью 0.7-0.8 разрыв между Gemma2-9B и Gemma2-27B сокращается с 10.3 процентных пунктов до 2.5, то есть нивелируется на 75.7%. По целым предметным областям разрывы между слабыми и сильными генераторами сокращаются в большинстве случаев на 30-50%. Выигрыш от верификации достигает пика на генераторах слабого и среднего уровня: они совершают ошибки, которые верификатор способен отсеять, и при этом генерируют достаточно правильных ответов, которые можно сохранить.
Замена GPT-4o на Qwen2.5-7B в качестве верификатора мало на что влияет в трёх режимах: на очень простых задачах, на очень сложных задачах и при сильных генераторах. Авторы прямо подчёркивают, что именно в этих режимах выигрыш от верификации составляет 0.1 или меньше для обоих верификаторов, поэтому результаты сходятся из-за того, что ни один из них не помогает. По выражению авторов, масштабирование одного лишь верификатора не позволяет преодолеть базовую сложность задачи.
В приложении приведён разбор затрат (case study). На тех же 181 задачах Qwen3-4B в одиночку показывает результат 0.938, GPT-4o в роли генератора - 0.952, а связка из генератора Qwen3-4B и верификатора GPT-4o - 0.954. При этом GPT-4o тратит 193 токена на промпт в роли верификатора против 482 в роли генератора (в тексте статьи указано 483), то есть примерно в 2.5 раза меньше, поскольку вердикты лаконичны.
Ограничения
Во всех исследованных областях есть проверяемый эталонный ответ (ground truth), и ни одна из них не относится к программному коду. Верификация здесь лишь фильтрует пул сэмплов: критика не передаётся обратно и исправление не выполняется, так что работа оценивает детекцию ошибок, а не их исправление. Сложность вычисляется как оракульная метрика на основе эталонной разметки, хотя оценка без разметки, как сообщается, даёт те же тренды. В обзоре связанных работ цитируется параллельное исследование (Lu et al., 2025), показавшее особую эффективность кросс-семейной верификации; этой работы в vault нет.
Связанные страницы
- cross-model-code-review - самое сильное подтверждение пользы от связки более слабого автора и более сильного проверяющего, а также ориентир того, где эта схема перестаёт окупаться
- reviewer-capability-rejection-targeting - сторона исправления ошибок, которую данная работа оставляет за скобками
- small-model-code-judges - генерация и отбор с помощью небольшой обученной модели-судьи на коде
- constraint-decay-backend-agents - связный, но структурно ошибочный код представляет собой программный аналог трудноуловимых ошибок сильного генератора