HF 論文速讀 2026-07-15

VLA 從「模仿軌跡」走向意圖解耦、世界模型 latent 與輕量化落地,旁支則用預訓練 MLLM 當零樣本 T2I reward。
今天機器人論文多在解耦意圖/動作與壓參數;另有 SpectraReward 讓預訓練 MLLM 免標註直接當生圖 RL 獎勵。
今天先記三件事
- MINT 用頻域多尺度 token 分 Intent 與 Execution,CALVIN 86.1%、LIBERO-90 98.7% 雙…
- Evo-1 僅 0.77B、無 robot 預訓練仍拿 Meta-World MT50 80.6% SOTA,強調保留 VLM 語意對齊。
- SpectraReward 以圖條件 prompt log-likelihood 當訓練免費 reward,Self 版可閉環自改進統一多…
五篇速讀
模仿意圖,而非僅軌跡(MINT)
意圖解耦 SOTA
為什麼重要:CALVIN ABCD→D 86.1%、LIBERO-90 98.7% 雙 #1;把行為拆成可轉移的 Intent 與細節 Execution。
帶走什麼:DCT 多尺度 VAE 強制低頻=意圖、高頻=執行;Intent token 可 one-shot 注入做技能轉移。
下一步:做長程操控/泛化時優先讀 MINT 的 spectral tokenization 與 intent ensemble。
Chain of World:在 latent motion 做世界模型思考
世界模型 VLA
為什麼重要:統一 world-model 時序推理與解耦 latent motion,CALVIN ABCD→D 80.9% 排 #2。
帶走什麼:視頻 VAE 拆 structure/motion;預訓推 latent motion 鏈與終點 keyframe,再與動作共微調。
下一步:若現有 VLA 只學幀差、缺長程動態,對照 CoWVLA 的 chain-of-world 預訓。
VLA 任務適配:2025 BEHAVIOR Challenge 冠軍方案
挑戰賽冠軍
為什麼重要:50 項長程家務雙臂任務 private 成功 12.4% 拿 #1;Pi0.5 上加 flow matching 與 stage tracking。
帶走什麼:correlated noise flow matching、mixed-layer attention、System 2 階段追蹤與 inference 壓縮/規則修正。
下一步:要衝長程 household benchmark 時,直接對齊其訓練與 inference 工程清單。
Evo-1:保留語意對齊的輕量 VLA
輕量部署
為什麼重要:0.77B、無 robot 預訓練仍 Meta-World MT50 80.6% #1,利於即時與低記憶體部署。
帶走什麼:原生多模態 backbone + cross-modulated diffusion;兩階段訓練避免破壞 VLM 語意空間。
下一步:邊緣/消費級 GPU 部署或嫌大模型太重時,優先評估 Evo-1 架構與開源權重。
Read It Back:預訓練 MLLM 當零樣本 T2I reward
零樣本 reward
為什麼重要:免偏好標註與 reward 微調,把預訓練對齊能力直接當生圖 RL 獎勵;HF 討論熱度高。
帶走什麼:SpectraReward=圖條件 teacher-forced prompt 平均 log-likelihood;Self 版用自身理解支路閉環。
下一步:做 diffusion/UMM 的 RL 後訓時,先試 SpectraReward 再比外部 judge 或 VQA 拆題。