穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-07-15

HF 論文速讀 2026-07-15

VLA 從「模仿軌跡」走向意圖解耦、世界模型 latent 與輕量化落地,旁支則用預訓練 MLLM 當零樣本 T2I reward。

今天機器人論文多在解耦意圖/動作與壓參數;另有 SpectraReward 讓預訓練 MLLM 免標註直接當生圖 RL 獎勵。

今天先記三件事

  1. MINT 用頻域多尺度 token 分 Intent 與 Execution,CALVIN 86.1%、LIBERO-90 98.7% 雙…
  2. Evo-1 僅 0.77B、無 robot 預訓練仍拿 Meta-World MT50 80.6% SOTA,強調保留 VLM 語意對齊。
  3. SpectraReward 以圖條件 prompt log-likelihood 當訓練免費 reward,Self 版可閉環自改進統一多…

五篇速讀

模仿意圖,而非僅軌跡(MINT)

意圖解耦 SOTA

為什麼重要:CALVIN ABCD→D 86.1%、LIBERO-90 98.7% 雙 #1;把行為拆成可轉移的 Intent 與細節 Execution。

帶走什麼:DCT 多尺度 VAE 強制低頻=意圖、高頻=執行;Intent token 可 one-shot 注入做技能轉移。

下一步:做長程操控/泛化時優先讀 MINT 的 spectral tokenization 與 intent ensemble。

Chain of World:在 latent motion 做世界模型思考

世界模型 VLA

為什麼重要:統一 world-model 時序推理與解耦 latent motion,CALVIN ABCD→D 80.9% 排 #2。

帶走什麼:視頻 VAE 拆 structure/motion;預訓推 latent motion 鏈與終點 keyframe,再與動作共微調。

下一步:若現有 VLA 只學幀差、缺長程動態,對照 CoWVLA 的 chain-of-world 預訓。

VLA 任務適配:2025 BEHAVIOR Challenge 冠軍方案

挑戰賽冠軍

為什麼重要:50 項長程家務雙臂任務 private 成功 12.4% 拿 #1;Pi0.5 上加 flow matching 與 stage tracking。

帶走什麼:correlated noise flow matching、mixed-layer attention、System 2 階段追蹤與 inference 壓縮/規則修正。

下一步:要衝長程 household benchmark 時,直接對齊其訓練與 inference 工程清單。

Evo-1:保留語意對齊的輕量 VLA

輕量部署

為什麼重要:0.77B、無 robot 預訓練仍 Meta-World MT50 80.6% #1,利於即時與低記憶體部署。

帶走什麼:原生多模態 backbone + cross-modulated diffusion;兩階段訓練避免破壞 VLM 語意空間。

下一步:邊緣/消費級 GPU 部署或嫌大模型太重時,優先評估 Evo-1 架構與開源權重。

Read It Back:預訓練 MLLM 當零樣本 T2I reward

零樣本 reward

為什麼重要:免偏好標註與 reward 微調,把預訓練對齊能力直接當生圖 RL 獎勵;HF 討論熱度高。

帶走什麼:SpectraReward=圖條件 teacher-forced prompt 平均 log-likelihood;Self 版用自身理解支路閉環。

下一步:做 diffusion/UMM 的 RL 後訓時,先試 SpectraReward 再比外部 judge 或 VQA 拆題。