Agent Reading Test
- title
- Agent Reading Test
- type
- toolbox
- summary
- Бенчмарк для оценки того, как coding-агенты читают и извлекают факты из веб-документации
- tags
- ai-agents, benchmarks, documentation
- language
- HTML
- license
- MIT
- created
- 2026-04-07
- updated
- 2026-04-07
- lang
- ru
- translation_of
- agent-reading-test
- source_updated
- 2026-04-07
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Бенчмарк, проверяющий, умеют ли AI coding-агенты читать и извлекать информацию из веб-документации. Десять страниц описывают вымышленную платформу "DataStream", и каждая нацелена на отдельный сценарий сбоя из спецификации Agent-Friendly Documentation Spec. Агент загружает страницы, отвечает на конкретные вопросы и сам сообщает о том, что нашёл. Результат сопоставляется с эталонными ответами для получения оценки.
Как это устроено
Тест размещён на agentreadingtest.com. Агенту передаётся адрес /start/, где перечислены 10 заданий со ссылками на страницы. В каждом задании задаётся конкретный технический вопрос - определить параметры API, описать настройки пула по умолчанию, перечислить типы агрегаций, показать код инициализации SDK, объяснить политики повторных попыток и так далее.
Правила:
- Загружать каждый URL ровно один раз (без повторных попыток - проверяется понимание с одного прохода)
- Отвечать только на основе того, что действительно есть на странице
- Выполнить все 10 заданий перед переходом на
/results/для подсчёта баллов
Страницы спроектированы так, чтобы вскрывать характерные слабые места агентов: пропуск вложенных деталей, путаницу между похожими именами параметров, игнорирование условных требований, неверное прочтение блоков кода. Каждая страница нацелена на один сценарий сбоя из Agent-Friendly Documentation Spec.
Что проверяется
Здесь проверяется не способность агента отвечать на вопросы по теме, на которой он обучался: платформа DataStream вымышлена, поэтому агенту приходится именно читать и извлекать данные. Задания варьируются от простых (перечислить эти значения конфигурации) до каверзных (определить, что изменилось между аутентификацией v1 и v2).
Бенчмарк использует llms-txt по адресу /llms.txt/ как машиночитаемый индекс сайта, следуя формирующейся конвенции для документации, предназначенной для навигации агентов.
Практическое применение
Запустите его на своём coding-агенте, чтобы увидеть, как он справляется с многостраничной веб-документацией. Это полезно для оценки фреймворков агентов, стратегий промптинга или реализаций работы с инструментами (tool-use). Ответы открыты, поэтому подсчёт баллов можно автоматизировать.
Автор - agent-ecosystem. Репозиторий: https://github.com/agent-ecosystem/agent-reading-test