# 视觉模型直接读 PDF vs 先 OCR 再问答：一次长文档实测

> 原标题：Vision-capable LLMs vs. OCR for long-document (including charts, images, tables, etc.) QA

- 来源：r/LocalLLaMA
- 发布时间：2026-05-24T03:05:31.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/26338
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tm0800/visioncapable_llms_vs_ocr_for_longdocument/

## 摘要

作者用 Claude Sonnet 4.5 跑了 MMLongBench-Doc 里的 30 份带图、带表格的 PDF，共 171 道题，对比两种路线：让模型直接看 PDF 画面，和先用 OCR 把文档转成文字再喂给模型。直接看 PDF 的准确率只有 52.0%，在六套方案里排第五，每次查询成本 0.2552 美元。表现最好的是 LlamaCloud ...

## 推荐理由

作者拿 Claude Sonnet 4.5 直接读 PDF 图片，在 MMLongBench-Doc 上跑出 52.0% 准确率，每题烧掉 0.2552 美元，比 LlamaCloud 的 OCR 管线低了 7.6 个百分点。样本只有 30 份文档、171 道题，结论别急着推广，但至少说明现在原生视觉模型处理带图表的长文档还不稳，而且贵。正文没披露具体文档类型分布和问题难度，这点先打个折。

## 锐评

这篇测试把两种文档问答路线摆在一起比了比：让 Claude Sonnet 4.5 直接看 PDF 画面，准确率只有 52.0%，在六套方案里排第五，每次查询成本 0.2552 美元。表现最好的是先用 LlamaCloud 把文档转成文字再喂给模型，准确率拉到 59.6%，成本反而降到 0.1885 美元。也就是说，直接看画面既不准又更贵，OCR 路线反而更省钱。

不过得打个折。测试只用了 MMLongBench-Doc 里的 30 份 PDF、171 道题，样本量不大，结论能不能推广到其他类型的文档还不清楚。正文也没披露这 30 份文档的具体构成，比如图表占比多少、扫描质量如何，这些都会影响 OCR 和视觉路线的表现差距。另外，测试只用了 Claude 一款模型，换成 Gemini 或 GPT-4o 这类视觉能力更强的模型，排名会不会变，正文也没说。

还缺一个关键信息：OCR 路线的预处理时间成本。LlamaCloud 解析一份长文档要多久、出错率多高，这些都没提。如果解析环节经常翻车或者耗时太长，那省下来的查询费用可能就被前置成本吃掉了。
