腾讯混元开源端到端OCR大模型HyOCR-1.5 推理提速6倍
10亿参数跑进企业文档场景
腾讯混元又开源了一款「小而能打」的模型。7月12日,混元团队宣布端到端 OCR 大模型 HyOCR-1.5 正式发布,并且把代码、模型权重和评测基准做了「全栈开源」——不只是放出权重,连部署方案和测试基准一起交了出来。
别看 OCR 是个「苦活」,它的需求其实极广。每一家企业都坐着成堆的扫描合同、发票、报表和档案,过去要么雇人录,要么搭一套脆弱的识别流水线,遇到手写、表格、多语言就频繁出错。把这件事压到一个轻量模型里,对企业来说是很实在的降本。
HyOCR-1.5 的体量很克制,大约 10亿参数,定位是「端到端 OCR 专家型 VLM(视觉语言模型)」。它直接从图像输入到文本输出,不需要传统 OCR 那套手工流水线和规则配置。真正的技术亮点是 DFlash 投机解码框架:在标准 Transformers 推理下,整体速度提升6.37倍;在 vLLM 高性能框架下也有2.14倍提升,单页文档端到端处理压缩到约1.408秒。
能力边界也够用。它支持最高4K分辨率图像输入,并提供最长128K的上下文窗口,能啃下批量合同、财报、扫描档案和多页复杂 PDF。官方在 GitHub 上给出了完整部署说明,推荐在显存约20GB的 NVIDIA GPU 上用 vLLM 或 Hugging Face 启动,意味着中高端单卡就能跑起来。
应用场景很务实。金融、政务、法律、教育这些文档密集行业,过去要搭一整套 OCR 流水线,工程成本高、维护麻烦;端到端架构可以从原始图像一键生成版面结构、文本内容和语义标签。
这类模型并不是头一个做 OCR 的,但它的路数和传统方案不一样。老办法是把检测、识别、版面分析拆成好几个模型和规则串起来,哪一段掉链子整体就崩;HyOCR-1.5 走的是「一个 VLM 通吃」的端到端路线,把版面、语义一起学进去,泛化更稳。
这次全栈开源,等于把「强识别能力」和「可部署性」同时塞进了一个轻量模型里。对想在多语言复杂文档上自研应用的团队,它既是开箱即用的基础能力,也是进一步微调的底座。