EnglishРусский Map

Structured Output Benchmark (SOB)

title
Structured Output Benchmark (SOB)
type
summary
summary
Открытый бенчмарк Interfaze для структурированного вывода LLM по 7 метрикам: JSON-Pass опережает Value-Accuracy на 15-30 пунктов у всех ведущих моделей.
tags
llm, benchmark, structured-output, evaluation, json-schema
created
2026-04-30
updated
2026-04-30
lang
ru
source_updated
2026-04-30
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-high

Компания Interfaze опубликовала Structured Output Benchmark (SOB) (вместе со статьёй на arXiv 2604.25359, датасетом на HuggingFace и онлайн-лидербордом), чтобы дать однозначный ответ на вопрос: "насколько хорошо модель извлекает структурированные данные из неидеального реального ввода". Бенчмарк нацелен на практические задачи - парсинг счетов, медицинские карты, извлечение данных из расшифровок встреч, перенос из PDF в базу данных, - где выдуманное значение или перепутанное поле молча ломают последующий код.

Что упускают прежние бенчмарки

Большинство существующих бенчмарков структурированного вывода (JSONSchemaBench, StructEval, DeepJSONEval, LLMStructBench) сводят всё к вопросу: "парсится ли ответ и проходит ли валидацию по схеме". SOB выделяет пять проблем такого подхода:

  • Модель может выдать идеальный JSON с абсолютно неверными значениями и получить 100%
  • Исключительно текстовый ввод из одного источника упускает реальные сценарии с OCR, скриншотами и аудио
  • Простые и сложные схемы оцениваются одинаково, скрывая, какие модели реально справляются с вложенностью
  • Ошибки парсинга, структуры и значений смешиваются в единую оценку
  • Рассуждения и chain-of-thought влияют на результат, из-за чего невозможно изолированно оценить навык извлечения данных

Как устроен SOB

Три модальности, единый конвейер оценки. Записи взяты из HotpotQA (5000 текстовых), olmOCR-bench (209 изображений) и AMI Meeting Corpus (115 аудио). Каждая запись снабжена схемой JSON Schema и выверенным эталонным ответом (составлен человеком, перепроверен с помощью LLM). Чтобы отделить навык структурированного вывода от vision-OCR и ASR, изображения и аудио предварительно преобразуются в нормализованный текстовый контекст. Все модели получают одинаковый очищенный от модальностей ввод, а разница в результатах объясняется именно работой со схемой.

Семь метрик вместо одной. Для каждой записи:

Метрика Что измеряет
Value Accuracy Точное совпадение значений листьев с эталоном (основная)
JSON Pass Rate Ответ является корректным JSON
Type Safety Типы всех значений листьев соответствуют объявленным типам в JSON Schema
Structure Coverage Обязательные объекты и массивы присутствуют и имеют правильную форму
Path Recall Присутствуют все обязательные пути (ключи) JSON
Faithfulness Значения опираются на исходный контекст, а не галлюцинированы
Perfect Response Каждое значение листа абсолютно корректно для всей записи

Два порога оценки. Жёсткая отсечка: если парсинг JSON провалился, семантические метрики для этой записи обнуляются. Покрытие: Value Accuracy засчитывается только для полей, возвращённых моделью, а отсутствующие пути считаются ошибкой. Сложность схемы учитывается через веса (простая=1.0, средняя=2.0, сложная=3.0), благодаря чему лидерборд отражает работу со сложными вложенными схемами, а не только тривиальные случаи.

Без рассуждений. Все модели запускаются с temperature 0.0, лимитом вывода в 2048 токенов и с отключённым reasoning/thinking везде, где это позволяет провайдер. Оценка отражает чистую способность к извлечению информации.

Главный вывод

Первая пятёрка общего лидерборда уложилась в диапазон одного балла: GPT-5.4 (0.870), GLM-4.7 (0.861), Qwen3.5-35B (0.861), Gemini-2.5-Flash (0.860), Qwen3-235B (0.857). Собственная бета-версия Interfaze занимает 6-е место (0.855), Claude-Sonnet-4.6 - 7-е (0.854).

Главная новость не в рейтинге, а в разрыве между JSON Pass и Value Accuracy:

Модель JSON Pass Value Accuracy Разрыв
GPT-5.4 99.3% 79.8% 19.5 п. п.
Qwen3.5-35B 96.9% 80.1% 16.8 п. п.
GLM-4.7 96.5% 80.4% 16.1 п. п.
Schematron-8B 98.7% 73.1% 25.6 п. п.
Nemotron-3-Nano-30B 98.7% 74.7% 24.0 п. п.

Каждая современная модель показывает от 95% и выше по JSON Pass - этот тест перестал быть критерием отбора для передовых моделей ещё годы назад. При этом Value Accuracy повсеместно оказывается на 15-30 пунктов ниже. Бенчмарки, оценивающие только проходимость формата, скрывали треть реальных ошибок в каждом публичном заголовке. См. json-pass-value-accuracy-gap.

Закономерности, о которых стоит помнить

  1. Валидный JSON ≠ корректный JSON. Тот самый разрыв выше.
  2. Структурные метрики маскируют ошибки в значениях. Path Recall, Structure Coverage и Type Safety могут показывать 99%+, пока 20-30% значений листьев неверны, а показатель Perfect Response падает примерно до половины даже у лучших моделей.
  3. Размер модели ничего не гарантирует. Qwen3.5-35B и GLM-4.7 обходят GPT-5 и Claude-Sonnet-4.6 по Value Accuracy. Phi-4 (14B) на тексте слегка опережает GPT-5 и GPT-5-Mini.
  4. Структурированные галлюцинации - самый коварный баг. Неверное значение, совпадающее по типу со схемой и выглядящее правдоподобно, проходит любые проверки. Пример из SOB: эталон "target_market_age": "15 to 35 years", а модель возвращает "25 to 35" - без проверки каждого поля это не заметить.
  5. Навыки в разных модальностях не переносятся. Лучшая Value Accuracy: текст - 83.0%, изображения - 67.2%, аудио - 23.7%. Аудио проваливается из-за большой длины расшифровок (~7300 токенов) и перекрывающихся реплик говорящих.
  6. Лидеры различаются в зависимости от модальности. GLM-4.7 лидирует на тексте, Gemma-4-31B - на изображениях, Gemini-2.5-Flash - на аудио. Ни одна модель не доминирует во всех трёх категориях, но текстовые лидерборды скрывают этот факт.

На что SOB не претендует

Оценка проводится в один прогон, с низкой температурой и без цепочек рассуждений. Поэтому она не отражает дисперсию результатов, не показывает поведение reasoning-моделей при включённых рассуждениях и не охватывает рекурсивные типы, объединения (unions) или большие перечисления enum. Авторы планируют добавить эти направления в следующих версиях.

Кроме того, бенчмарк не даёт ответа, какая модель "лучшая" в абсолюте: расстановка мест зависит от конкретной метрики. Отчёт подталкивает читателя выбирать метрику под свои ограничения в продакшене (Value Accuracy, если последующий пайплайн доверяет полям без ручной проверки; Faithfulness, если галлюцинации критичны; Perfect Response, если запись должна быть корректной целиком).

Зачем Interfaze это публикует

Interfaze разрабатывает собственную модель для структурированного вывода и использует бенчмарк в том числе для позиционирования своего продукта (он занимает 6-е место в общем зачёте). Авторы открыто об этом заявляют: "первый шаг к улучшению структурированного вывода - измерить его и сопоставить себя с лучшими". Бенчмарк, датасет и код для запуска оценки открыты (GitHub).

Связанные страницы

  • interfaze - сущность
  • json-pass-value-accuracy-gap - концепция о главном выводе исследования
  • clean-code-coding-agents - аргументы из того же семейства ("поверхностная метрика обманчива"), но в другой предметной области
  • claude-emotion-concepts - смежная тема: ещё одна открытая оценка, где методология интереснее итогового рейтинга