穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-07-16

HF 論文速讀 2026-07-16

Document AI 與 OCR 正快速走向大規模 visual-text 預訓練、輕量 end-to-end 解析,以及中文與事件流等長尾場景強化。

今天重點是 MonkeyOCRv2 用 1.13 億文件影像做 visual-text 基礎模型,以及 OvisOCR2 以 0.8B end-to-end 在 OmniDocBench 拿到 96.58 SOTA。

今天先記三件事

  1. MonkeyOCRv2 以 113M、17 語文件影像聯合 image-to-text 與像素重建,強化字級視覺感知。
  2. OvisOCR2 僅 0.8B,靠 SFT、RL 蒸餾與 fusion,在 OmniDocBench v1.6 拿下 96.58 end-…
  3. Scene text 持續細分:LMIM 自監督、EventSTR 事件流、CCR-CLIP 中文 IDS 對齊皆刷新榜。

五篇速讀

MonkeyOCRv2:文件 AI 的 Visual-Text 基礎模型

文件視覺底座

為什麼重要:自然影像 encoder 難應付密文與字劃;需文件導向大規模預訓練才能穩做 Document AI。

帶走什麼:MonkeyDoc v2 有 113M 張、17 語;聯合 image-to-text 與像素重建,換 encoder 五項任務全面提升。

下一步:做 OCR/解析/篡改偵測時,優先評估以它替換原 vision encoder。

OvisOCR2 技術報告

輕量端到端解析

為什麼重要:過去排行榜多被 pipeline 佔據;小模型 end-to-end 若能登頂,實務部署價值立刻放大。

帶走什麼:0.8B 直接出閱讀順序 Markdown;OmniDocBench v1.6 總分 96.58、PureDocBench Avg3 75.06 皆領先。

下一步:需要可部署文件解析時,優先對照其 Markdown 輸出與 in-house 長尾測評。

語言感知 Masked Image Modeling 的自監督場景文字辨識

STR 自監督

為什麼重要:場景文字資料貴、標註難;語言感知 MIM 能更有效吃未標註字圖。

帶走什麼:LMIM 在 Union14M-U 80% patch masking 預訓練後,BCTR 多子集拿下 rank #2(如 Document LACC 99.1)。

下一步:缺標註的 STR 專案可先試 linguistics-aware MIM 再微調。

EventSTR:事件流場景文字辨識基準與基線

事件相機 STR

為什麼重要:高動態、低光場景下 RGB 易失效;事件流提供新感知路徑與可比較基準。

帶走什麼:SimC-ESTR 全設定在 EventSTR 測試集 BLEU-1~4 皆 rank #1(BLEU-4 0.430)。

下一步:做極端光照或高速文字時,改測 event stream 管線並對照此 benchmark。

以 CLIP 式 Image-IDS 對齊做中文文字辨識

中文 STR 對齊

為什麼重要:中文字形結構複雜;用 IDS 把印刷字圖對到構字序列,能補字形先驗。

帶走什麼:CCR-CLIP 兩階段後,中文過濾 CTR 上多子集 NED rank #1(如 Document NED 0.997)。

下一步:中文手寫/場景字辨識可把 IDS 對齊當 pretrain 監督訊號。