HF 論文速讀 2026-08-10

世界模型與多模態 tokenizer/agent 正同時把生成先驗壓進可控規劃與長時串流理解。
今天重點:用生成當訓練訊號、不確定性感知與工具化多模態,把世界模型做成可部署的規劃器與長時 agent。
今天先記三件事
- SimWAM 把影片生成當訓練訊號,推論可丟棄 video 分支,91.5 PDMS、延遲更低。
- KVAE 以 tokenizer 家族在音訊重建/生成與影像壓縮多項拿到 SOTA 或前段。
- StreamArena 用小時級開放式串流評測,暴露「連續互動 vs 長時多模態記憶」張力。
五篇速讀
KVAE:多模態生成模型的 Tokenizer 家族
Tokenizer S…
為什麼重要:在固定 0.6B Kandinsky-5 DiT 下做 tokenizer 對照,音訊與影像壓縮/生成多榜領先。
帶走什麼:好 tokenizer 直接拉高下游生成與重建;MUSDB18-HQ SI-SDR 10.39、多項 AudioCaps/OmniDoc 名次突出。
下一步:做多模態生成時優先對齊其 tokenization 設定與壓縮指標,再換 generator。
ToolArtist:會用工具的統一多模態 agent 影像生成
工具化生成
為什麼重要:從 Emu3.5 以 RL 後訓,整合推理、文/圖搜尋與原生影像生成,WISE 總分 0.79 排名前段。
帶走什麼:Agentic 影像生成=理解+工具呼叫+生成一體;官方 WISE WiScore 協議下具競爭力。
下一步:做可搜尋、可推理的生圖 agent 時對標其工具介面與 RL 後訓路徑。
SimWAM:端到端自駕的簡潔 World-Action Model
自駕基線
為什麼重要:現有 WAM 推論要產未來幀成本高;SimWAM 只把影片當訓練訊號,推論剩輕量 planner。
帶走什麼:joint flow matching+隔離 attention,video expert 可換、action expert 可獨立擴;NAVSIM 91.5 PDMS 並 ze…
下一步:先讀架構與 mask 設計,當低延遲 WAM 基線複現,再加其 compositional RL reward。
不確定性感知世界模型:空拍影像目標導航
UAV 導航
為什麼重要:戶外未來狀態高度不確定,單點預測不夠;UA-NWM 用不確定性子空間做軌跡打分。
帶走什麼:把預測-目標落差拆成可解釋/不可解釋,只用不確定性無法解釋的殘差評分,免多次採樣且延遲低。
下一步:空拍 image-goal 或高不確定規劃可仿其 OOD 式 scoring,並對照實機 UAV 設定。
StreamArena:連續互動、長時程 agent 串流影片理解
長時基準
為什麼重要:短片+選擇題讓「只看最近幾幀」也能刷分;需小時級、開放式、可互動評測。
帶走什麼:243 支約 88.8 分鐘影片、3646 開放 QA,涵蓋即時感知、回溯、主動互動與多模態工具;記憶策略全面吃緊。
下一步:做串流 agent 先用 StreamArena 壓測長時記憶,再對照文中 StreamMind 雙層思路。