HF 論文速讀 2026-07-25

今日核心趨勢:從小型推理模型、遞迴研究 Agent 到真實機器人資料,AI 正走向可驗證、可落地、可規模化的行動能力。
真正拉開差距的,不只是模型更會回答,而是能以高品質資料、約束驗證與工具流程,持續完成複雜任務的系統。
今天先記三件事
- Xiaomi-Robotics-1 用超過 10 萬小時真實軌跡,推進 VLA 的資料規模化。
- AREX 把深度研究拆成研究、驗證、再研究的遞迴閉環。
- 3B 級 Nanbeige 顯示小模型若訓練得當,也能挑戰高階推理任務。
五篇速讀
Xiaomi-Robotics-1:以超過 10 萬小時真實軌跡擴展視覺語言行動模型
具身 AI 規模化
為什麼重要:它用大量真實操作軌跡與自動語言標註,驗證 VLA 能隨資料與模型規模持續提升。
帶走什麼:機器人泛化的關鍵不只在模型架構,更在可擴張、帶有狀態轉換描述的真實資料管線。
下一步:關注其自動標註流程,以及預訓練能力如何轉移至不同機器人本體。
Nanbeige4.1-3B:能推理、對齊與行動的小型通用模型
小模型推理
為什麼重要:3B 模型在 GPQA/World Knowledge 取得 83.8 Accuracy,凸顯小模型仍可具備強推理潛力。
帶走什麼:參數量不是能力的唯一代理指標;訓練、對齊與 Agent 行動設計同樣能放大模型價值。
下一步:追查其 reasoning、alignment、acting 三者的訓練配方與成本。
Nanbeige4-3B 技術報告:探索小型語言模型前沿
數學推理小鋼炮
為什麼重要:其 Thinking-2511 checkpoint 在 AIME 2024 報告 90.4 Accuracy,評估採 avg@8。
帶走什麼:小模型的數學表現需連同取樣設定與評估協定閱讀,不能只把單一分數當成絕對能力。
下一步:比較 avg@8 與單次作答表現,並檢視 64K generation 的實務成本。
AREX:邁向可遞迴自我改進的深度研究 Agent
研究 Agent 閉環
為什麼重要:AREX 將答案產生與逐項驗證分離,利用未解決約束驅動下一輪針對性研究。
帶走什麼:長程研究 Agent 的競爭力,在於把證據、已驗證結論與未解問題壓縮成可持續更新的狀態。
下一步:用多約束研究題測試:能否列出主張、證據、缺口與下一步查證。
FinanceComplexQA:工業級金融文件的 Agent 推理評測
金融文件評測
為什麼重要:它以複雜版面金融文件建立開放式深度研究任務,測試 Agent 在真實文件推理的穩定性。
帶走什麼:企業 Agent 評估不能只看問答正確率,還要測跨版面、跨語言、引用與多步研究能力。
下一步:若做金融或企業文件 Agent,可借鏡其任務分類與 Agent-as-a-Judge 評估。