Interfaze
- title
- Interfaze
- type
- entity
- summary
- ИИ-стартап, разрабатывающий детерминированную модель для структурированного вывода и парсинга; автор бенчмарка Structured Output Benchmark (апрель 2026)
- tags
- company, llm, structured-output, benchmark
- created
- 2026-04-30
- updated
- 2026-04-30
- lang
- ru
- translation_of
- interfaze
- source_updated
- 2026-04-30
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Interfaze (interfaze.ai, сейчас в бете) разрабатывает модель для задач детерминированного структурированного вывода - парсинга счетов, медицинских карт, расшифровок аудио, OCR, переноса данных из PDF в базы данных. Их тезис в том, что универсальные frontier-модели справляются с этим достаточно плохо, поэтому специализированная модель, обученная под правильные метрики, заслуживает отдельного продукта.
В апреле 2026 года они опубликовали Structured Output Benchmark (SOB) - см. structured-output-benchmark - вместе со статьёй arXiv 2604.25359, датасетом на HuggingFace и онлайн-лидербордом. В едином лидерборде бенчмарка их собственная модель Interfaze-Beta занимает 6-е место (Overall 0.855), уступая GPT-5.4, GLM-4.7, Qwen3.5-35B, Gemini-2.5-Flash, Qwen3-235B и опережая Claude-Sonnet-4.6, GPT-5, Gemma-3-27B и другие.
Что интересно помимо самой модели
Бенчмарк представляет собой более долговечный вклад. Разделяя оценку на семь метрик по трём модальностям (текст/изображения/аудио) и взвешивая результат по сложности схемы, SOB вскрывает json-pass-value-accuracy-gap: показатель JSON Pass Rate превышает 95%+ у всех frontier-моделей, однако точная точность значений в листьях (leaf-value accuracy) оказывается на 15-30 процентных пунктов ниже. Этот разрыв - самое полезное опровержение звучащих в 2026 году заявлений о том, что "задача структурированного вывода уже решена".
Сама Interfaze честно описывает конфликт интересов в своём позиционировании: они выпускают бенчмарк, по которому будут оценивать их собственный продукт. Неявная ставка делается на то, что достоверные публичные измерения ценнее, чем подгонка под закрытые внутренние метрики.
Упоминания в вики
- structured-output-benchmark - подробный разбор SOB, методологии и основных результатов
- json-pass-value-accuracy-gap - отдельная концепция, описывающая главный вывод бенчмарка