穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-07-26

HF 論文速讀 2026-07-26

今天的共同趨勢是:AI 能力競爭正從單點模型分數,轉向資料規模、集合級檢索與多代理推理流程的系統化協作。

模型不只要更會答題,更要靠大規模真實資料、挑對資訊組合,以及可擴展的推理協作,才能在真實任務穩定落地。

今天先記三件事

  1. Xiaomi-Robotics-1 用超過 10 萬小時真實軌跡,驗證 VLA 的資料與模型擴展律。
  2. 檢索品質不能只看單篇相關性,文件間的冗餘、衝突與互補會決定生成上限。
  3. 文件理解開始用多代理測試期擴展,把規劃、執行、判斷與修正拆開協作。

五篇速讀

Xiaomi-Robotics-1:以超過 10 萬小時真實軌跡擴展視覺語言行動模型

具身 AI 擴展律

為什麼重要:它把 VLA 的核心瓶頸拉回真實資料規模,並展示預訓練擴展可轉移到後訓練與新任務適應。

帶走什麼:做機器人基礎模型時,真實軌跡、自然語言狀態轉換標註與模型規模要一起擴展。

下一步:優先看兩階段訓練與自動標註設計,評估能否套用到自家機器人資料管線。

超越相關性檢索:以評分規準導向文件集合選擇與排序

Agent 檢索升級

為什麼重要:它指出 nDCG 式單篇排序忽略文件互動;最佳 reranker 的評分規準覆蓋率仍不超過 45%。

帶走什麼:給 Agent 的不是幾篇最相關文件,而是一組低冗餘、可互補且衝突可控的證據集合。

下一步:把 SetwiseEvalKit 的九維度當 RAG 評估清單,先檢查重複與衝突內容。

OneVision-Encoder:以 Codec 對齊稀疏性作為多模態智慧基礎原則

視覺編碼器

為什麼重要:在受控原生解析度設定下,搭配 Qwen3-4B probe 於 OCRBench v2 取得 30.8 Accuracy。

帶走什麼:視覺編碼器的表示效率與語言模型探針配置,會共同影響 OCR 能力,不能只看單一元件。

下一步:注意公開 HF 僅提供 vision encoder,評測結果所用完整對齊組合尚未公開。

Nanbeige4.1-3B:能推理、對齊與行動的小型通用模型

小模型能力

為什麼重要:官方模型卡與論文表格都指出,它在 GPQA 的 World Knowledge 項目取得 83.8 Accuracy。

帶走什麼:小型通用模型也能同時追求推理、對齊與行動能力,部署選型不應只看參數量。

下一步:若關注邊緣或成本敏感部署,進一步比較其任務能力與實際工具調用表現。

視覺文件理解與問答:結合測試期擴展的多代理協作框架

文件多代理

為什麼重要:四代理流程在 DUDE、InfoVQA 居首,並在 DocVQA 取得第二;核心是代理級自適應測試期擴展。

帶走什麼:複雜文件問答可拆成規劃、執行、判斷、回答,並把更多推理預算放在真正不確定的環節。

下一步:用它的四角色拆解自家文件 QA pipeline,再測量修正迴路是否值得額外成本。