HF 速讀AI 論文
HF 論文速讀 2026-06-18

今天共同趨勢:AI 評測正從靜態問答走向可驗證推理、長程記憶、具身操作與真實產業場景。
小模型推理在衝高,真正難題轉向記憶、物理、操作與多圖實務可靠性。
今天先記三件事
- VibeThinker-3B 把小模型可驗證推理推到前線水準。
- RNG-Bench 專測多模態模型互動中是否記得過去觀察。
- 新 benchmark 更重視可控、可稽核、貼近真實任務。
五篇速讀
VibeThinker-3B:小模型的可驗證推理極限
小模推理
為什麼重要:3B dense model 在數學、程式與指令遵循上逼近大型旗艦模型。
帶走什麼:後訓練流程可能比參數量更關鍵,尤其在可驗證任務上。
下一步:優先看訓練 pipeline 與 test-time scaling 設計。
RNG-Bench:多模態模型真的記得看過什麼嗎
記憶評測
為什麼重要:把多模態模型在互動中重建過去觀察的能力獨立測出來。
帶走什麼:長上下文不等於可用記憶,仍要分辨遺忘與動作選錯。
下一步:用它檢查 agent 是否能在非 Markov 場景行動。
Guava:用工具 harness 釋放具身操作能力
具身工具
為什麼重要:指出有效具身 agent 需要迭代感知推理行動、語意動作與多模態觀察。
帶走什麼:不一定要端到端 VLA,好的 harness 可釋放模型操作能力。
下一步:評估自家 embodied agent 的 workflow 與 action abstraction。
Physics-IQ Verified:校準影片模型的物理理解測驗
物理校準
為什麼重要:系統稽核 Physics-IQ,降低 prompt 與 ground-truth 混淆因子。
帶走什麼:影片模型物理理解排名會受評測品質影響,需更可靠訊號。
下一步:看 Verified 版如何重寫樣本、prompt 與 scoring。
IndustryBench-MIPU:工業產品多圖規格抽取基準
產業多圖
為什麼重要:聚焦工業產品規格抽取,測 MLLM 跨多張異質圖片整合證據。
帶走什麼:真實產業理解不只是 OCR,還要圖紙推理與領域術語解碼。
下一步:拿來測產品資料建檔、採購與供應鏈自動化。