穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-08-06

HF 論文速讀 2026-08-06

多模態與代理系統在文件理解、電腦操作、世界模型、可擴推理與高效影片生成同步刷新 SOTA。

今天五篇都在 Papers with Code 拿下前段排名:Gemma 4 文件視覺、弱點學習電腦代理、Cosmos 3 生圖、均衡推理解數獨、OSP-Next 影片生成。

今天先記三件事

  1. Gemma 4 在 InfoVQA 文件理解 ANLS 92.0 居首,思考模式搭配最大 1120 vision tokens。
  2. Learn from Weaknesses 以分域專精拿下 OSWorld 均值成功率 62.24(八域三試、50 步限)。
  3. Equilibrium Reasoners 以 test-time depth 64、breadth 128 在 Sudoku-Extre…

五篇速讀

Gemma 4 技術報告

多模態基座刷新

為什麼重要:InfoVQA 上文件理解 ANLS 92.0 排名第一、影像理解 92.0 第二,證明強視覺-文件能力。

帶走什麼:思考模式在最大支援解析度(1120 vision tokens)下跑出上述分數,文件理解是亮點。

下一步:做 OCR/文件 VQA 或長視覺上下文時優先對照 Table 6 與 thinking mode 設定。

從弱點學習:小型電腦使用代理的自動化領域專精

電腦代理專精

為什麼重要:OSWorld 電腦使用代理成功率 62.24 排名第一,專攻小型 agent 的領域自動專精。

帶走什麼:對各 OSWorld domain 分開做 LearnWeak 專精,八域三試平均、50 步限制下的均值。

下一步:做 desktop/GUI agent 時按域拆分弱點專精,並固定步數與多次 trial 評估。

Cosmos 3:面向 Physical AI 的全模態世界模型

世界模型生圖

為什麼重要:HPSv3 影像生成 overall 分數 11.60 排名第一,對準 Physical AI 的 omnimodal 世界模型。

帶走什麼:Cosmos3-Super-Text2Image 在 1024×1024 與 Claude-Opus-4.7 prompt 改寫協議下的 Table 11 結果。

下一步:做 text-to-image 或具身/物理模擬前置世界模型時,對齊該 checkpoint 與評測協議。

均衡推理器:學習吸引子以實現可擴展推理

可擴測試時推理

為什麼重要:Sudoku-Extreme 準確率 99.8 排名第一,用吸引子學習把推理深度與廣度拉到可擴尺度。

帶走什麼:test-time depth 64、breadth 128,聚合隨機軌跡且不依賴外部 verifier。

下一步:難題搜索/組合推理可試 attractor 式 test-time scaling,先在數獨類基準驗證軌跡聚合。

OSP-Next:稀疏序列並行、HiF8 量化與強化學習的高效高品質影片生成

高效影片生成

為什麼重要:VBench 總分 83.73(品質 85.19、語意 77.86)排名第二,兼顧效率與品質。

帶走什麼:以 Wan2.1-T2V-14B 為底,結合 sparse sequence parallelism、HiF8 與 RL;分數以百分比回報。

下一步:要在有限算力跑 14B 級 T2V 時,優先看稀疏序列並行與 HiF8 的速度-品質取捨。