# 腾讯混元开源 HyOCR-1.5：1B 参数的端到端 OCR 模型，推理速度提升 6.37 倍

> 原标题：腾讯混元发布 HyOCR-1.5：端到端 OCR 大模型全栈开源，推理提速 6.37 倍

- 来源：AI HOT 精选
- 发布时间：2026-07-13T11:12:59.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44036
- 原文：https://mp.weixin.qq.com/s/vKFCa9FfoGBUGK8J1MhFag

## 摘要

腾讯混元把 HyOCR-1.5 的训练代码、推理代码和模型权重全开源了，这在端到端 OCR 大模型里是头一个。模型只有 1B 参数，能处理文档解析、公式识别、表格还原等 8 种以上的文字任务。在 OmniDocBench v1.6 上拿了 94.74 分，排在端到端模型的第一名。推理速度这块，它用了一个叫 DFlash 的投机解码方法，在 Transf...

## 推荐理由

腾讯混元把一个端到端 OCR 模型从训练到推理全开源了，不是只放权重。1B 参数在 OmniDocBench v1.6 上拿了 94.74 分，端到端模型里排第一，还靠 DFlash 把推理速度提了 6.37 倍。这对做文档解析或 RAG 的人来说，是个能直接上手试、省训练成本的开源选项。我会先打个折：正文没提模型在复杂版面、手写体或噪声场景下的具体表现，也没说 6.37 倍提速是在什么硬件和 batch size 下测的，这点先别太激动。但整体看，这是国内大厂一次实打实的全栈开源，不是公关稿。

## 锐评

HyOCR-1.5 这次最实在的动作是全栈开源，训练代码、推理代码、模型权重都放出来了，这在端到端 OCR 大模型里确实是头一个。模型只有 1B 参数，能处理文档解析、公式识别、表格还原等 8 种以上的文字任务，在 OmniDocBench v1.6 上拿了 94.74 分，排在端到端模型的第一名。推理速度这块，它用了一个叫 DFlash 的投机解码方法，在 Transformers 框架下推理速度提了 6.37 倍，在 vLLM 下提了 2.14 倍，端到端推理每页只要 1.408 秒。另外它还支持 4K 分辨率和 128K 上下文窗口，通过一种叫 Agentic Data Flow 的方法把低资源 OCR 扩展到了 331 种语言，还能认古文字、做多图问答。

不过有几个点得先打个折。正文没披露 94.74 分这个成绩是在什么硬件上跑的，也没说对比的其他端到端模型具体是哪些、分数差多少。DFlash 的加速效果在 Transformers 和 vLLM 下差了近三倍，说明这个加速方法对推理框架比较挑，实际部署时能拿到多少加速还得看环境。另外，331 种语言的 OCR 能力具体到什么程度、古文字识别准确率怎么样，正文都没给数字，这部分先别太激动。如果是真的能在 1B 参数下做到这个水平，部署成本确实挺省，但缺的验证信息还不少。
