EnglishРусский Map

Деградация под ограничениями: LLM-агенты в генерации бэкенд-кода

title
Деградация под ограничениями: LLM-агенты в генерации бэкенд-кода
type
summary
summary
Бенчмарк: кодинг-агенты теряют ~30 пунктов прохождения ассертов по мере накопления реальных структурных ограничений
tags
ai-coding, agents, benchmarks, backend
created
2026-07-21
updated
2026-09-13
lang
ru
source_updated
2026-09-13
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

В препринте на arXiv за май 2026 года Франческо Денте (Francesco Dente), Дарио Сатриани (Dario Satriani) и Паоло Папотти (Paolo Papotti; Папотти, как сообщается, работает в EURECOM, на странице аннотации аффилиация не указана) исследуют режим сбоя, названный авторами constraint-decay: LLM-агенты для написания кода хорошо справляются с нестрого сформулированными задачами, но резко деградируют по мере накопления структурных ограничений реального продакшен-кода - архитектурных паттернов, баз данных, ORM.

Бенчмарк включает 100 задач: 80 разработок с нуля (greenfield) и 20 реализаций отдельных возможностей на восьми веб-фреймворках. Каждая задача прогоняется от базового слабо специфицированного варианта до полностью специфицированных версий, где постепенно накладываются требования к продакшен-структуре; метрика - доля пройденных проверок (assertion pass rate). Главная цифра - падение примерно на 30 пунктов от базовой версии к полностью специфицированной, причём у самых слабых конфигураций результат падает почти до нуля. Одновременное выполнение функциональных требований (что код делает) и структурных (как он должен быть устроен), по выражению авторов, остаётся для агентов нерешённой задачей.

Две находки дополняют картину. Чувствительность к фреймворку: агенты показывают себя заметно лучше на минималистичных фреймворках вроде Flask, чем на перегруженных конвенциями FastAPI и Django, где большая часть правильного решения диктуется соглашениями, которым агент обязан следовать, а не придумывать их на ходу. И главная первопричина: дефекты слоя данных - некорректное составление запросов и рантайм-ошибки ORM - лидируют среди всех категорий сбоев. Не маршрутизация и не сериализация: именно на уровне базы данных агенты сильнее всего отклоняются от реальных требований задачи.

Это конкретное, измеренное подтверждение более общего тезиса из no-silver-bullet-llms о том, что качество работы LLM падает по мере удаления от хорошо задокументированной медианы - где под "медианой" понимается голый фреймворк без наложенной структуры. Это также согласуется с практическим отчётом в local-ai-is-not-opus, где локальная модель справлялась с чтением в ограниченном контексте, но ломалась на длительных задачах с жёсткими конвенциями. Практический вывод напрямую касается reviewing-ai-code: структурные ограничения - это именно то, что обязан проверять человек-ревьюер, поскольку именно на них агент молча ошибается.

Связанные страницы

  • constraint-decay - концепция и две сопутствующие закономерности
  • no-silver-bullet-llms - формулировка проблемы медианы, которую замеряет эта работа
  • reviewing-ai-code - почему проверка структурных ограничений ложится на плечи ревьюера
  • twelve-ways-wrong-ai-coding - каталог режимов сбоя кодинг-агентов
  • local-ai-is-not-opus - та же деградация, наблюдаемая на практике
  • verification-dynamics-llms - почему связный, но структурно неверный результат сильных генераторов сложнее всего отловить верификатору