Способности ревьюера определяют прицельность отклонений, а не качество исправлений
- title
- Способности ревьюера определяют прицельность отклонений, а не качество исправлений
- type
- summary
- summary
- Пилот на 100 задач: ревьюер из другого семейства даёт +12 пунктов, а самопроверка при лучшем recall ложно отклоняет 35% верных ответов.
- parent
- cross-model-code-review
- tags
- llm, llm-evaluation, agents, verification
- created
- 2026-09-13
- updated
- 2026-09-13
- lang
- ru
- translation_of
- reviewer-capability-rejection-targeting
- source_updated
- 2026-09-13
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Препринт одного автора, Файзана Танвира (FAST NUCES, Лахор), опубликованный 2 сентября 2026 года. В мультиагентных пайплайнах на роль ревьюера часто ставят более дешёвую модель ради экономии. Предыдущие исследования показывали, что этапы верификации помогают далеко не всегда, но там уровень ревьюера был примерно равен уровню исполнителя. Здесь же исполнитель фиксирован, а ревьюеров перебирают по шкале способностей вплоть до модели, которая вообще не может решить эти задачи, после чего классифицируют результат каждого отдельного отклонения. Автор называет это контролируемым пилотным исследованием, а не общим утверждением, и страница придерживается этой же рамки.
Постановка эксперимента
Пайплайн состоит из двух этапов. Исполнитель пишет решение, ревьюер принимает или отклоняет его с текстовой критикой (не видя эталонного ответа), а в случае отклонения исполнитель делает одну попытку исправления. В роли исполнителя выступает Gemini 3.1 Flash-Lite, решающая 52% тестового набора без посторонней помощи. Варьируются четыре условия для ревьюера: без ревью; самопроверка той же моделью; gpt-oss-20b как средний по уровню ревьюер из другого семейства; и Llama-3.1-8B как слабый ревьюер, не способный решить практически ни одной задачи. Все три модели принадлежат к разным семействам, поэтому самопроверка и внешнее ревью не смешиваются с различиями в способностях.
Набор состоит из 100 олимпиадных задач Omni-MATH диапазона сложности 5.0 - 6.0, ограниченных числовыми ответами, чтобы оценка была точной и в цепочке подсчёта баллов не участвовала модель. Дизайн эксперимента парный: исполнитель решает каждую задачу один раз, и этот же исходный ответ проходит проверку во всех условиях, поэтому различия обусловлены ревьюером, а не выборкой. Из-за rate limit у провайдера вход ревьюера пришлось урезать до последних 2000 символов решения, но даже при этом 16% ответов ревьюера из другого семейства вернулись в непарсируемом виде и были засчитаны как принятые, из-за чего измеренный recall этого ревьюера является нижней границей.
Результаты
Ревьюер из другого семейства поднял точность с 52% до 64% (точный тест Макнемара, p = 0.0005). Двенадцать задач перешли из неверных в верные, и ни одна не испортилась.
Самопроверка показала самую высокую долю обнаружения ошибок среди всех условий (recall 0.85), но не дала значимого прироста: +6 пунктов, что статистически незначимо при таком размере выборки. Такой recall был получен за счёт частых отклонений. Модель отклоняла ответы в 2.1 раза чаще, чем ревьюер из другого семейства, и ложно отклонила 35% изначально правильных ответов против 2% у внешнего ревьюера (парный p = 0.000015). Лишь 15% её отклонений привели к исправлению неверного ответа против 43% (p = 0.0074), а 41% отклонений ничего не изменили против 14%. С точки зрения избирательности самопроверке требовалось 6.6 отклонения на одно полезное исправление, а ревьюеру из другого семейства - 2.3. Прямое сравнение точности между этими двумя условиями (p = 0.238) обладает недостаточной мощностью, и статья на него не претендует.
Низкий уровень ущерба при самопроверке оказался удачей на стороне исполнителя. Из 18 ложных отклонений исполнитель согласился с критикой 3 раза, и во всех 3 случаях ответ стал неверным; в остальных 15 случаях он вернул тот же правильный ответ. Если бы исполнитель соглашался с каждым ложным отклонением, точность упала бы ниже базового уровня без ревью. Автор называет это инерцией ревизии (revision inertia): консервативный исполнитель может создать иллюзию безопасности некомпетентного ревьюера.
Слабый ревьюер не изменил ни одного из 100 итоговых ответов и примерно удвоил расход токенов. При сокращённом промпте он писал связный, осторожный текст и принимал практически всё; при исходном более длинном промпте он в основном возвращал пустой текст. Это делает нижний порог способностей зависимым от промпта, как отмечается в статье, а не фиксированным свойством модели.
Разграничение в заголовке статьи возникает из разделения прицельности (targeting) и исправления (repair). Из 52 правильных первых ответов 17 были ложно отклонены при самопроверке и ни одного - ревьюером из другого семейства (и ноль в обратную сторону). Навык исправления при условии, что исполнитель действительно менял ответ, составил 26% против 50% (p = 0.096, статистически незначимо при 35 и 24 попытках), а частота ошибочных правок оказалась близкой: 39% и 43%. Способности ревьюера определяли то, какие именно ответы отклоняются, гораздо отчётливее, чем качество исправления после отклонения.
Расход токенов на один дополнительный правильный ответ составил около 24 000 для ревьюера из другого семейства и около 26 000 для самопроверки, так что более качественный ревьюер не был дешевле в пересчёте на прирост. Он дал вдвое большее улучшение без единого испорченного ответа.
Протоколы работы
Три режима отказов проиллюстрированы отобранными вручную примерами. Самопроверка выдумывала обоснования: в одной геометрической задаче она сослалась на окружность девяти точек, чтобы заявить, что значение 17 слишком велико; исполнитель согласился, и эталонный ответ 17 превратился в 7. Она также бездоказательно утверждала формулы, одна из которых даёт 42 там, где правильный ответ 38. Слабый ревьюер выдавал складно написанные одобрения неверных ответов, пересказывая рассуждения исполнителя более гладким языком. Суть в том, что критика может быть конкретной, структурированной и математической, не проверяя при этом ровным счётом ничего.
Ограничения и происхождение
Один исполнитель, один бенчмарк, один диапазон сложности, один раунд правок, один шаблон промпта, математика, а не код, а также ограничения бесплатного тарифа на выбор моделей и размер выборки. Несколько пропорций опираются на малые знаменатели (3 случая порчи ответа, 9 и 12 исправлений), а попарные тесты не скорректированы на множественность сравнений. Изначально зарегистрированный план предполагал другое исследование: предсказывает ли разнообразие ошибок между моделями пользу от мультиагентного пайплайна. Калибровка показала отсутствие диапазона сложности, где все три модели ошибались бы сопоставимо, и исследование переориентировали на сам разброс способностей как переменную, причём поправка была оформлена до отчётного прогона. Оба документа сохранены в репозитории.
При конвертации в HTML пропали таблицы результатов, поэтому собственные результаты ревьюеров без посторонней помощи на этом наборе задач отсутствуют в копии в vault. В статье gpt-oss-20b называется моделью среднего уровня (mid-tier) и не утверждается, что она сильнее исполнителя, что важно, когда этот результат цитируют в подтверждение тезиса "проверять должна более сильная модель".
См. также
- cross-model-code-review - синтез этой статьи с другими работами о ролях ревьюера и исполнителя
- llm-self-verification-limits - исследование 2024 года на GPT-4, обнаружившее такое же избыточное отклонение при самокритике
- verification-dynamics-llms - более крупное исследование взаимодействия способностей верификатора и генератора
- llm-output-variance - почему пилот на 100 задач следует воспринимать как указание на направление, а не на величину эффекта