HF 速讀AI 論文
HF 論文速讀 2026-06-19

今天共同趨勢是把隱含能力外顯成可控結構:3D幾何、深度、loop與debug流程都被制度化。
下一波提升不只靠更大模型,而是把3D、深度與推理迴圈做成可訓練結構。
今天先記三件事
- Robot VLA正在吃進人類第一人稱影片
- 3D幾何成為操作策略的新核心
- test-time scaling不是越多loop越好
五篇速讀
ACE-Ego-0:把第一人稱人類影片變成 VLA 預訓練燃料
資料橋接
為什麼重要:把昂貴robot trajectory擴展到大規模egocentric human videos。
帶走什麼:關鍵是pseudo-action、camera-space action與可靠度感知訓練。
下一步:看它如何處理人類與機器人action mismatch。
GAM:用幾何 foundation model 讓機器人真的看見 3D
今日首看
為什麼重要:直接把geometric foundation model改造成語言條件robot policy。
帶走什麼:VLA若只靠2D latent,contact-rich manipulation仍可能不夠。
下一步:優先讀GFM split與future token prediction設計。
LoopCoder-v2:test-time computation 只多繞一圈最划算
迴圈縮放
為什麼重要:指出PLT中兩個loop帶來收益,但三個以上反而退化。
帶走什麼:test-time computation scaling存在非單調最佳點。
下一步:比較two-loop對SWE-bench與Multi-SWE的增益。
DepthVLM:把 dense metric depth 打進 VLM 的視覺理解核心
深度VLM
為什麼重要:訊號顯示dense metric depth可補強VLM的空間理解與計數能力。
帶走什麼:深度不是附加任務,而可能是VLM視覺理解的核心表徵。
下一步:回原文核對POPE、CountBench、ScienceQA設定。
MGDebugger:用階層式除錯補上 code generation 最後一哩路
除錯補強
為什麼重要:用hierarchical debugging改善程式生成後的正確性。
帶走什麼:最後一哩不一定靠重寫模型,也可靠系統化debug迭代。
下一步:看它的debug階層與最多10輪迭代流程。