Вариативность выдачи LLM
- title
- Вариативность выдачи LLM
- type
- concept
- summary
- Вариативность выдачи LLM столь высока, что сравнения на малых выборках и скалярные бенчмарки позволяют доказать практически любой вывод
- tags
- benchmarking, agentic-coding, llm-skepticism
- created
- 2026-07-21
- updated
- 2026-07-21
- lang
- ru
- translation_of
- llm-output-variance
- source_updated
- 2026-07-21
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Результаты работы LLM и агентов достаточно сильно колеблются - как между прогонами одного и того же промпта, так и между задачами, - из-за чего большинство выводов после пары-тройки попыток оказываются чистым шумом. В danluu-ai-coding-testing Дэн Лу (Dan Luu) сформулировал это предельно чётко: какой бы вывод о модели или трюке в рабочем процессе вы ни хотели получить, на небольшом числе прогонов его всегда можно подтвердить.
Две оси вариативности
- От прогона к прогону: одна и та же модель с одинаковым уровнем усилий (effort level) на одной и той же задаче даёт разброс. В одном из бенчмарков Лу стандартное отклонение между прогонами составило ~7.5% производительности. Разрыв между лучшей и худшей моделями в его тестах оказался меньше, чем одно стандартное отклонение в прогонах одной модели. Так что вердикт "я попробовал новую модель, и она лучше" при n=1-2 неотличим от простой удачи.
- От задачи к задаче: модель, побеждающая на одной задаче, проигрывает на следующей. Всего на трёх самодельных бенчмарках Лу нашёл подтверждение каждому противоречивому утверждению, звучавшему на релизе GPT-5.5 ("5.4 лучше", "5.5 дешевле, потому что сразу работает" и т. д.) - просто потому, что на какой-то конкретной задаче каждое из них было правдой.
"Покажите распределение"
Практический вывод для бенчмарков: единая итоговая оценка в рейтинге моделей почти бессмысленна. Публичные бенчмарки сводят большой и разнородный набор задач к одному числу, но большинство задач либо насыщены (4/4 у хороших моделей или 0/4 у всех), либо ранжирование определяется крошечной выборкой решающих тестов. Стоит заменить несколько из них, и "однозначно превосходящая" SOTA-модель меняется: Opus 4.8 обходит GPT-5.5, затем вперёд вырывается GLM-5.2. Подача результатов с высокой точностью ("на 1% лучше при снижении затрат на 19%") создаёт иллюзию детализации, которой в данных попросту нет. Аналогия Лу: Мигель Индурайн (Miguel Indurain) - либо величайший велогонщик всех времён, либо забытый специалист по раздельному старту в зависимости от того, какой длины этапы с раздельного старта организаторы Tour de France решат включить в гонку. Подкрутите бенчмарк - изменится легенда.
Даже бенчмарки, которые, казалось бы, измеряют ровно то, что вам нужно, на практике могут выворачиваться наизнанку. В двух бенчмарках Opus оценивается куда выше GPT по способности "не выдумывать ерунду", однако Лу и другие регулярно замечают, что на реальной отладке Opus 4.x обосновывает чепуху чаще, чем GPT-5.x - настолько, что для создания сильного игрового ИИ GPT потребовал меньше подсказок и подталкиваний, что прямо противоположно вердикту короткого бенчмарка.
Разбор кейса: caveman mode
Наглядный пример. "Caveman mode" (промпт для краткости, обещавший сокращение токенов на 75%) активно рекомендовали повсюду; каждый сетевой "eval" представлял собой сгенерированный LLM SEO-спам с кучей ошибок, а сам автор инструмента назвал его шуткой. Лу сгенерировал три реальных бенчмарка примерно за 15 секунд каждый и прогнал их по 50 раз на разных моделях и уровнях усилий. После двух прогонов это выглядело как безоговорочная победа; после 50 эффект в среднем свёлся к ничтожному и нестабильному от задачи к задаче. Мораль касается не только caveman mode: почти никто не проводит достаточно испытаний, чтобы отличить реальный эффект от дисперсии, поэтому рекомендации распространяются на базе случайных совпадений за пару прогонов и суеверий. (Формулировка Мэтта Мулленвега (Matt Mullenweg) в пересказе Лу: деятельность с высокой дисперсией порождает суеверия - вроде игроков в казино со "счастливыми носками".)
Последствия
- Сравнения моделей на малых выборках ненадёжны. Утверждение "X лучше Y" в общем случае неверно, если только разрыв в возможностях не огромен; без всякой предвзятой подборки можно найти примеры, где предыдущее поколение Anthropic бьёт текущее поколение OpenAI и наоборот.
- Снижение ложноположительных срабатываний через повторение работает по причине, напрямую связанной с дисперсией: независимые прогоны и независимые взгляды агентов снижают уровень ошибок - именно поэтому agent-failure-mode-skill опирается на перепроверки и ролевые маски (personas).
- Бенчмарки служат лабораториям, а не пользователям. Публичные таблицы лидеров (leaderboards) ничего не говорят конкретному человеку о том, какую модель выбрать под его набор задач, а динамика выручки показывает, что на реальное внедрение они тоже не влияют.
См. также: testing-heavy-no-review-workflow (дисперсия - причина, по которой нельзя доверять единственному прогону тестов), reviewing-ai-code, structured-output-benchmark.
- Working around agent failure modes is the skill
- Which Tools Do Claude Code, Codex and Cursor Choose?
- Cross-model code review
- Dan Luu on AI Coding, Testing, and Variance
- Dan Luu (danluu.com)
- Differential spec analysis
- LLMs: Intelligence vs. Cost
- The Log is the Agent
- Reviewer Capability Governs Rejection Targeting, Not Repair Skill
- SWR-Bench: LLM Code Review Comment Generation on Real Pull Requests
- Testing-heavy, no-review workflow