# PaddlePaddle 开源 HPD-Parsing：一个 10 亿参数模型，文档解析跑到每秒 4752 个 token，比之前最快的方案还快 1.62 倍

> 原标题：PaddlePaddle/HPD-Parsing · Hugging Face

- 来源：r/LocalLLaMA
- 发布时间：2026-07-23T07:56:12.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46099
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1v479m5/paddlepaddlehpdparsing_hugging_face/

## 摘要

PaddlePaddle 在 Hugging Face 上放出了一个叫 HPD-Parsing 的文档解析模型，参数只有 10 亿，主打一个快。它的思路是把文档解析拆成两步：一个主分支负责看懂整页的排版结构，然后把各个局部区域的内容分派给多个分支同时生成，不再像传统模型那样一个字一个字地按顺序吐结果。每个分支内部还用了一种叫“渐进式多 token 预测...

## 推荐理由

PaddlePaddle 放出一个 10 亿参数的文档解析模型，用分层并行解码替代逐 token 生成，架构上有明显新意，直接打中本地 RAG 和文档处理从业者的需求。正文没给基准对比和具体延迟数字，所以先打 72 分。

## 锐评

PaddlePaddle 放出的 HPD-Parsing 是个10亿参数的小模型，专门做文档解析，就是把扫描件、PDF 里的文字和排版结构读出来。它的核心思路很直接：整页的布局需要全局协调，但每个区域的内容生成是相对独立的。所以它不再像传统模型那样一个字一个字按顺序吐结果，而是让一个主分支看懂整体排版，然后把各个局部区域分派给多个分支同时生成。每个分支内部还用了一种叫“渐进式多 token 预测”的技术，一次预测多个词，进一步减少解码步数。

在 OmniDocBench v1.6 测试集上，它拿到了 94.91% 的综合分，是目前端到端统一解析器里的最高分。速度方面，峰值吞吐达到 4752 TPS，是之前最快解析器的 1.62 倍，是自己传统自回归版本的 3.06 倍。训练上用了分阶段适配和自动难度筛选的数据管线，试图在转向并行解码时保住精度。

不过这篇帖子没披露任何硬件配置或显存需求，所以这个 4752 TPS 是在什么卡上跑的、实际部署成本多少，都得自己验证。另外，94.91% 的分数看着漂亮，但 OmniDocBench 本身对中文文档的覆盖度有限，中文场景的表现还得额外测。
