# SOB 基准测试：专门给大模型的结构化输出能力挑错

> 原标题：Show HN: A new benchmark for testing LLMs for deterministic outputs

- 来源：Hacker News 首页
- 发布时间：2026-04-29T16:01:51.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11750
- 原文：https://interfaze.ai/blog/introducing-structured-output-benchmark

## 摘要

Interfaze 发布了一个叫 SOB 的基准测试，专门看大模型从文本、图片、音频里提取信息并输出成 JSON 时，到底靠不靠谱。它不像老测试只看 JSON 格式对不对，而是重点查字段里的值准不准——比如发票金额有没有瞎编。测试覆盖了 5000 条文本、209 张图片和 115 段音频，每道题都有人工核对过的标准答案。结果发现，大部分模型在格式上都能...

## 推荐理由

我会先打个折：这是 Show HN 首发，没有外部采用信号，所以分数压在 75。但内容本身对做结构化输出的团队有用——它不测模型会不会聊天，只测模型能不能老老实实按 schema 吐出对的类型和值。GLM-4.7 总榜第二是个钩子，但真正值得盯的是 GPT-5.4 在文本任务排第 3、图像任务掉到第 9，说明多模态下字段值错会明显放大。正文没披露测试集规模和领域分布，这点先别太激动，但方法论上把 schema 准确率、类型准确率、值准确率拆开算，比只看一个总分要实在。

## 锐评

Interfaze 搞的这个 SOB 基准测试，核心就干了一件事：把结构化输出的评测从“格式正确”升级到“数值正确”。它不像老测试只看 JSON 能不能解析、符不符合 schema，而是拿人工核对过的标准答案去对字段值，比如发票金额、会议日期有没有编造。测试覆盖了 5000 条文本、209 张图片和 115 段音频，图片和音频在评分前会先转成文本，尽量排除视觉和语音识别能力的干扰，专门看模型提取信息、填进 JSON 时的准确度。

结果挺说明问题：大部分模型在 JSON 格式、类型安全这些结构指标上都能跑到接近满分，但一到 Value Accuracy（字段值准确率）和 Perfect Response（整条记录全对的比例）就拉开差距了。GPT-5.4 在文本提取上排第三，到了图片场景直接掉到第九，说明看图填表比读文本容易出错得多。GLM-4.7 总排名第二，是个值得关注的开源选手。

不过得打个折：图片和音频的样本量偏小（209 张图、115 段音频），统计上可能不够稳。正文也没说清楚“人工核对加 LLM 交叉验证”的具体流程，标准答案本身有没有被 LLM 带偏，这点存疑。另外，测试把图片和音频都转成文本再评分，虽然能隔离提取能力，但也意味着它测的不是端到端的真实多模态表现，实际业务里 OCR 和语音识别出错的影响被抹掉了。
