騰訊混元開源端到端OCR大模型HyOCR-1.5 推理提速6倍
10億引數跑進企業文件場景
騰訊混元又開源了一款「小而能打」的模型。7月12日,混元團隊宣佈端到端 OCR 大模型 HyOCR-1.5 正式釋出,並且把程式碼、模型權重和評測基準做了「全棧開源」——不只是放出權重,連部署方案和測試基準一起交了出來。
別看 OCR 是個「苦活」,它的需求其實極廣。每一家企業都坐著成堆的掃描合同、發票、報表和檔案,過去要麼僱人錄,要麼搭一套脆弱的識別流水線,遇到手寫、表格、多語言就頻繁出錯。把這件事壓到一個輕量模型裡,對企業來說是很實在的降本。
HyOCR-1.5 的體量很剋制,大約 10億引數,定位是「端到端 OCR 專家型 VLM(視覺語言模型)」。它直接從影象輸入到文字輸出,不需要傳統 OCR 那套手工流水線和規則配置。真正的技術亮點是 DFlash 投機解碼框架:在標準 Transformers 推理下,整體速度提升6.37倍;在 vLLM 高效能框架下也有2.14倍提升,單頁文件端到端處理壓縮到約1.408秒。
能力邊界也夠用。它支援最高4K解析度影象輸入,並提供最長128K的上下文視窗,能啃下批次合同、財報、掃描檔案和多頁複雜 PDF。官方在 GitHub 上給出了完整部署說明,推薦在視訊記憶體約20GB的 NVIDIA GPU 上用 vLLM 或 Hugging Face 啟動,意味著中高階單卡就能跑起來。
應用場景很務實。金融、政務、法律、教育這些文件密集行業,過去要搭一整套 OCR 流水線,工程成本高、維護麻煩;端到端架構可以從原始影象一鍵生成版面結構、文字內容和語義標籤。
這類模型並不是頭一個做 OCR 的,但它的路數和傳統方案不一樣。老辦法是把檢測、識別、版面分析拆成好幾個模型和規則串起來,哪一段掉鏈子整體就崩;HyOCR-1.5 走的是「一個 VLM 通吃」的端到端路線,把版面、語義一起學進去,泛化更穩。
這次全棧開源,等於把「強識別能力」和「可部署性」同時塞進了一個輕量模型裡。對想在多語言複雜文件上自研應用的團隊,它既是開箱即用的基礎能力,也是進一步微調的底座。