EnglishРусский Map

Agent Reading Test

title
Agent Reading Test
type
toolbox
summary
Бенчмарк для оценки того, как coding-агенты читают и извлекают факты из веб-документации
tags
ai-agents, benchmarks, documentation
language
HTML
license
MIT
created
2026-04-07
updated
2026-04-07
lang
ru
translation_of
agent-reading-test
source_updated
2026-04-07
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

Бенчмарк, проверяющий, умеют ли AI coding-агенты читать и извлекать информацию из веб-документации. Десять страниц описывают вымышленную платформу "DataStream", и каждая нацелена на отдельный сценарий сбоя из спецификации Agent-Friendly Documentation Spec. Агент загружает страницы, отвечает на конкретные вопросы и сам сообщает о том, что нашёл. Результат сопоставляется с эталонными ответами для получения оценки.

Как это устроено

Тест размещён на agentreadingtest.com. Агенту передаётся адрес /start/, где перечислены 10 заданий со ссылками на страницы. В каждом задании задаётся конкретный технический вопрос - определить параметры API, описать настройки пула по умолчанию, перечислить типы агрегаций, показать код инициализации SDK, объяснить политики повторных попыток и так далее.

Правила:

  • Загружать каждый URL ровно один раз (без повторных попыток - проверяется понимание с одного прохода)
  • Отвечать только на основе того, что действительно есть на странице
  • Выполнить все 10 заданий перед переходом на /results/ для подсчёта баллов

Страницы спроектированы так, чтобы вскрывать характерные слабые места агентов: пропуск вложенных деталей, путаницу между похожими именами параметров, игнорирование условных требований, неверное прочтение блоков кода. Каждая страница нацелена на один сценарий сбоя из Agent-Friendly Documentation Spec.

Что проверяется

Здесь проверяется не способность агента отвечать на вопросы по теме, на которой он обучался: платформа DataStream вымышлена, поэтому агенту приходится именно читать и извлекать данные. Задания варьируются от простых (перечислить эти значения конфигурации) до каверзных (определить, что изменилось между аутентификацией v1 и v2).

Бенчмарк использует llms-txt по адресу /llms.txt/ как машиночитаемый индекс сайта, следуя формирующейся конвенции для документации, предназначенной для навигации агентов.

Практическое применение

Запустите его на своём coding-агенте, чтобы увидеть, как он справляется с многостраничной веб-документацией. Это полезно для оценки фреймворков агентов, стратегий промптинга или реализаций работы с инструментами (tool-use). Ответы открыты, поэтому подсчёт баллов можно автоматизировать.

Автор - agent-ecosystem. Репозиторий: https://github.com/agent-ecosystem/agent-reading-test