腾讯混元开源 HyOCR-1.5:1B 参数的端到端 OCR 模型,推理速度提升 6.37 倍
腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍
腾讯混元把 HyOCR-1.5 的训练代码、推理代码和模型权重全开源了,这在端到端 OCR 大模型里是头一个。模型只有 1B 参数,能处理文档解析、公式识别、表格还原等 8 种以上的文字任务。在 OmniDocBench v1.6 上拿了 94.74 分,排在端到端模型的第一名。推理速度这块,它用了一个叫 DFlash 的投机解码方法,在 Transf...
推荐理由:腾讯混元把一个端到端 OCR 模型从训练到推理全开源了,不是只放权重。1B 参数在 OmniDocBench v1.6 上拿了 94.74 分,端到端模型里排第一,还靠 DFlash 把推理速度提了 6.37 倍。这对做文档解析或 RAG 的人来说,是个能直接上手试、省训练成本的开源选项。我会先打个折:正文没提模型在复杂版面、手写体或噪声场景下的具体表现,也没说 6.37 倍提速是在什么硬件和 batch size 下测的,这点先别太激动。但整体看,这是国内大厂一次实打实的全栈开源,不是公关稿。