Structured Output Benchmark (SOB)
- title
- Structured Output Benchmark (SOB)
- type
- summary
- summary
- Открытый бенчмарк Interfaze для структурированного вывода LLM по 7 метрикам: JSON-Pass опережает Value-Accuracy на 15-30 пунктов у всех ведущих моделей.
- tags
- llm, benchmark, structured-output, evaluation, json-schema
- created
- 2026-04-30
- updated
- 2026-04-30
- lang
- ru
- translation_of
- structured-output-benchmark
- source_updated
- 2026-04-30
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-high
Компания Interfaze опубликовала Structured Output Benchmark (SOB) (вместе со статьёй на arXiv 2604.25359, датасетом на HuggingFace и онлайн-лидербордом), чтобы дать однозначный ответ на вопрос: "насколько хорошо модель извлекает структурированные данные из неидеального реального ввода". Бенчмарк нацелен на практические задачи - парсинг счетов, медицинские карты, извлечение данных из расшифровок встреч, перенос из PDF в базу данных, - где выдуманное значение или перепутанное поле молча ломают последующий код.
Что упускают прежние бенчмарки
Большинство существующих бенчмарков структурированного вывода (JSONSchemaBench, StructEval, DeepJSONEval, LLMStructBench) сводят всё к вопросу: "парсится ли ответ и проходит ли валидацию по схеме". SOB выделяет пять проблем такого подхода:
- Модель может выдать идеальный JSON с абсолютно неверными значениями и получить 100%
- Исключительно текстовый ввод из одного источника упускает реальные сценарии с OCR, скриншотами и аудио
- Простые и сложные схемы оцениваются одинаково, скрывая, какие модели реально справляются с вложенностью
- Ошибки парсинга, структуры и значений смешиваются в единую оценку
- Рассуждения и chain-of-thought влияют на результат, из-за чего невозможно изолированно оценить навык извлечения данных
Как устроен SOB
Три модальности, единый конвейер оценки. Записи взяты из HotpotQA (5000 текстовых), olmOCR-bench (209 изображений) и AMI Meeting Corpus (115 аудио). Каждая запись снабжена схемой JSON Schema и выверенным эталонным ответом (составлен человеком, перепроверен с помощью LLM). Чтобы отделить навык структурированного вывода от vision-OCR и ASR, изображения и аудио предварительно преобразуются в нормализованный текстовый контекст. Все модели получают одинаковый очищенный от модальностей ввод, а разница в результатах объясняется именно работой со схемой.
Семь метрик вместо одной. Для каждой записи:
| Метрика | Что измеряет |
|---|---|
| Value Accuracy | Точное совпадение значений листьев с эталоном (основная) |
| JSON Pass Rate | Ответ является корректным JSON |
| Type Safety | Типы всех значений листьев соответствуют объявленным типам в JSON Schema |
| Structure Coverage | Обязательные объекты и массивы присутствуют и имеют правильную форму |
| Path Recall | Присутствуют все обязательные пути (ключи) JSON |
| Faithfulness | Значения опираются на исходный контекст, а не галлюцинированы |
| Perfect Response | Каждое значение листа абсолютно корректно для всей записи |
Два порога оценки. Жёсткая отсечка: если парсинг JSON провалился, семантические метрики для этой записи обнуляются. Покрытие: Value Accuracy засчитывается только для полей, возвращённых моделью, а отсутствующие пути считаются ошибкой. Сложность схемы учитывается через веса (простая=1.0, средняя=2.0, сложная=3.0), благодаря чему лидерборд отражает работу со сложными вложенными схемами, а не только тривиальные случаи.
Без рассуждений. Все модели запускаются с temperature 0.0, лимитом вывода в 2048 токенов и с отключённым reasoning/thinking везде, где это позволяет провайдер. Оценка отражает чистую способность к извлечению информации.
Главный вывод
Первая пятёрка общего лидерборда уложилась в диапазон одного балла: GPT-5.4 (0.870), GLM-4.7 (0.861), Qwen3.5-35B (0.861), Gemini-2.5-Flash (0.860), Qwen3-235B (0.857). Собственная бета-версия Interfaze занимает 6-е место (0.855), Claude-Sonnet-4.6 - 7-е (0.854).
Главная новость не в рейтинге, а в разрыве между JSON Pass и Value Accuracy:
| Модель | JSON Pass | Value Accuracy | Разрыв |
|---|---|---|---|
| GPT-5.4 | 99.3% | 79.8% | 19.5 п. п. |
| Qwen3.5-35B | 96.9% | 80.1% | 16.8 п. п. |
| GLM-4.7 | 96.5% | 80.4% | 16.1 п. п. |
| Schematron-8B | 98.7% | 73.1% | 25.6 п. п. |
| Nemotron-3-Nano-30B | 98.7% | 74.7% | 24.0 п. п. |
Каждая современная модель показывает от 95% и выше по JSON Pass - этот тест перестал быть критерием отбора для передовых моделей ещё годы назад. При этом Value Accuracy повсеместно оказывается на 15-30 пунктов ниже. Бенчмарки, оценивающие только проходимость формата, скрывали треть реальных ошибок в каждом публичном заголовке. См. json-pass-value-accuracy-gap.
Закономерности, о которых стоит помнить
- Валидный JSON ≠ корректный JSON. Тот самый разрыв выше.
- Структурные метрики маскируют ошибки в значениях. Path Recall, Structure Coverage и Type Safety могут показывать 99%+, пока 20-30% значений листьев неверны, а показатель Perfect Response падает примерно до половины даже у лучших моделей.
- Размер модели ничего не гарантирует. Qwen3.5-35B и GLM-4.7 обходят GPT-5 и Claude-Sonnet-4.6 по Value Accuracy. Phi-4 (14B) на тексте слегка опережает GPT-5 и GPT-5-Mini.
- Структурированные галлюцинации - самый коварный баг. Неверное значение, совпадающее по типу со схемой и выглядящее правдоподобно, проходит любые проверки. Пример из SOB: эталон
"target_market_age": "15 to 35 years", а модель возвращает"25 to 35"- без проверки каждого поля это не заметить. - Навыки в разных модальностях не переносятся. Лучшая Value Accuracy: текст - 83.0%, изображения - 67.2%, аудио - 23.7%. Аудио проваливается из-за большой длины расшифровок (~7300 токенов) и перекрывающихся реплик говорящих.
- Лидеры различаются в зависимости от модальности. GLM-4.7 лидирует на тексте, Gemma-4-31B - на изображениях, Gemini-2.5-Flash - на аудио. Ни одна модель не доминирует во всех трёх категориях, но текстовые лидерборды скрывают этот факт.
На что SOB не претендует
Оценка проводится в один прогон, с низкой температурой и без цепочек рассуждений. Поэтому она не отражает дисперсию результатов, не показывает поведение reasoning-моделей при включённых рассуждениях и не охватывает рекурсивные типы, объединения (unions) или большие перечисления enum. Авторы планируют добавить эти направления в следующих версиях.
Кроме того, бенчмарк не даёт ответа, какая модель "лучшая" в абсолюте: расстановка мест зависит от конкретной метрики. Отчёт подталкивает читателя выбирать метрику под свои ограничения в продакшене (Value Accuracy, если последующий пайплайн доверяет полям без ручной проверки; Faithfulness, если галлюцинации критичны; Perfect Response, если запись должна быть корректной целиком).
Зачем Interfaze это публикует
Interfaze разрабатывает собственную модель для структурированного вывода и использует бенчмарк в том числе для позиционирования своего продукта (он занимает 6-е место в общем зачёте). Авторы открыто об этом заявляют: "первый шаг к улучшению структурированного вывода - измерить его и сопоставить себя с лучшими". Бенчмарк, датасет и код для запуска оценки открыты (GitHub).
Связанные страницы
- interfaze - сущность
- json-pass-value-accuracy-gap - концепция о главном выводе исследования
- clean-code-coding-agents - аргументы из того же семейства ("поверхностная метрика обманчива"), но в другой предметной области
- claude-emotion-concepts - смежная тема: ещё одна открытая оценка, где методология интереснее итогового рейтинга