跳到正文
r/LocalLLaMA

视觉模型直接读 PDF vs 先 OCR 再问答:一次长文档实测

Vision-capable LLMs vs. OCR for long-document (including charts, images, tables, etc.) QA

作者用 Claude Sonnet 4.5 跑了 MMLongBench-Doc 里的 30 份带图、带表格的 PDF,共 171 道题,对比两种路线:让模型直接看 PDF 画面,和先用 OCR 把文档转成文字再喂给模型。直接看 PDF 的准确率只有 52.0%,在六套方案里排第五,每次查询成本 0.2552 美元。表现最好的是 LlamaCloud ...

推荐理由:作者拿 Claude Sonnet 4.5 直接读 PDF 图片,在 MMLongBench-Doc 上跑出 52.0% 准确率,每题烧掉 0.2552 美元,比 LlamaCloud 的 OCR 管线低了 7.6 个百分点。样本只有 30 份文档、171 道题,结论别急着推广,但至少说明现在原生视觉模型处理带图表的长文档还不稳,而且贵。正文没披露具体文档类型分布和问题难度,这点先打个折。

读原文 ↗导出 Markdown