# LlamaIndex 提出“用时才调”的智能 OCR：两遍式文档处理，在成本和精度之间找平衡

> 原标题：LlamaIndex 解析 just-in-time Agentic OCR：两遍式文档处理如何平衡成本与精度

- 来源：AI HOT 精选
- 发布时间：2026-09-10T16:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56153
- 原文：https://www.llamaindex.ai/blog/just-in-time-agentic-ocr

## 摘要

LlamaIndex 把文档处理拆成两遍：第一遍用轻量 OCR 快速把文字全扫出来，第二遍只在碰到图表、扫描页等“硬骨头”时，才调用视觉模型（VLM）做深度识别。他们在 84 份 SEC 文件上试了这套流程，先靠元数据和文本检索定位相关页面，再对少数页面做深度 OCR。这个做法适合数据室里的交互式问答，但不适合离线批处理——每次提问都可能触发新的 VL...

## 推荐理由

LlamaIndex 这套两遍式文档处理是个扎实的工程方案，有 84 份 SEC 文件的实测数据，也坦白了适用边界。但它本质是工具链层面的效率优化，不是模型或产品层面的突破，所以行业影响偏温和。72 分刚好卡在 featured 门槛上，我会先打个折，不往上抬。

## 锐评

这篇博客讲的是“按需 OCR”，核心逻辑是把文档处理分成两步走。第一遍用轻量 OCR 把文字全扫出来，速度快、成本低；第二遍只在遇到图表、扫描页这些硬骨头时，才调用视觉模型做深度识别。他们在 84 份 SEC 文件上试了这套流程，先靠文件元数据和文本检索定位相关页面，再对少数页面做深度 OCR。

这个做法适合数据室里的交互式问答场景——你问什么，它才去仔细看什么，不用提前把所有文件都做高成本解析。但它不适合离线批处理，因为每次提问都可能触发新的视觉模型调用，问得越多，延迟和成本就越高。

文章没给具体的成本对比和延迟数字，也没说轻量 OCR 和视觉模型分别用的是什么。84 份 SEC 文件的测试规模偏小，能不能扛住更大、更杂的文档集还不清楚。如果是真的能省下大笔视觉模型调用费，那对需要处理大量扫描件的金融、法律团队会挺有用，但没数据之前只能当个思路参考。
