穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-06-19

HF 論文速讀 2026-06-19

今天共同趨勢是把隱含能力外顯成可控結構:3D幾何、深度、loop與debug流程都被制度化。

下一波提升不只靠更大模型,而是把3D、深度與推理迴圈做成可訓練結構。

今天先記三件事

  1. Robot VLA正在吃進人類第一人稱影片
  2. 3D幾何成為操作策略的新核心
  3. test-time scaling不是越多loop越好

五篇速讀

ACE-Ego-0:把第一人稱人類影片變成 VLA 預訓練燃料

資料橋接

為什麼重要:把昂貴robot trajectory擴展到大規模egocentric human videos。

帶走什麼:關鍵是pseudo-action、camera-space action與可靠度感知訓練。

下一步:看它如何處理人類與機器人action mismatch。

GAM:用幾何 foundation model 讓機器人真的看見 3D

今日首看

為什麼重要:直接把geometric foundation model改造成語言條件robot policy。

帶走什麼:VLA若只靠2D latent,contact-rich manipulation仍可能不夠。

下一步:優先讀GFM split與future token prediction設計。

LoopCoder-v2:test-time computation 只多繞一圈最划算

迴圈縮放

為什麼重要:指出PLT中兩個loop帶來收益,但三個以上反而退化。

帶走什麼:test-time computation scaling存在非單調最佳點。

下一步:比較two-loop對SWE-bench與Multi-SWE的增益。

DepthVLM:把 dense metric depth 打進 VLM 的視覺理解核心

深度VLM

為什麼重要:訊號顯示dense metric depth可補強VLM的空間理解與計數能力。

帶走什麼:深度不是附加任務,而可能是VLM視覺理解的核心表徵。

下一步:回原文核對POPE、CountBench、ScienceQA設定。

MGDebugger:用階層式除錯補上 code generation 最後一哩路

除錯補強

為什麼重要:用hierarchical debugging改善程式生成後的正確性。

帶走什麼:最後一哩不一定靠重寫模型,也可靠系統化debug迭代。

下一步:看它的debug階層與最多10輪迭代流程。