HF 速讀AI 論文
HF 論文速讀 2026-06-14

多模態模型正在從離線理解走向即時互動、少步生成與可擴展空間推理。
今天重點是:生成模型不只會產圖,還開始學會深度、即時聆聽與跨影像影片理解。
今天先記三件事
- T2I spatial prior 可轉成強深度估計能力
- Audio model 正走向 always-on 即時互動
- 少步 diffusion 逼近高品質生成更成熟
五篇速讀
Modality Forcing:把影像生成變成深度感知預訓練
空間生成
為什麼重要:用單一 DiT 和稀疏深度資料,聯合生成 image-depth。
帶走什麼:T2I 的 spatial prior 可隨模型與資料規模轉成深度能力。
下一步:關注其在 DIODE、ScanNet、KITTI 的泛化表現。
Audio Interaction Model:讓語音模型邊聽邊決定何時回應
即時語音
為什麼重要:把離線 LALM 推向 always-on perceive-decide-respond。
帶走什麼:關鍵不只是聽懂語音,而是何時主動介入與回應。
下一步:優先看 SoundFlow、StreamAudio-2M 與推理設計。
Z-Image Turbo++:把高品質影像生成壓到 2 步
快速生圖
為什麼重要:針對 2-step generation 設計蒸餾與訓練策略。
帶走什麼:用 teacher-aligned adversarial target 可縮小 2 步品質落差。
下一步:比較 2-step 與 8-step teacher 的畫質與延遲取捨。
MatCha:讓視覺語言模型真的讀懂圖表與數學
圖表理解
為什麼重要:把 math reasoning 與 chart derendering 放進 VLP。
帶走什麼:圖表任務需要結構還原,不只是一般 OCR 或 caption。
下一步:看 PlotQA 評估設定與 5% numerical tolerance。
Video-LLaVA:先對齊再投影,統一影像與影片表示
影音對齊
為什麼重要:主張先 alignment before projection 統一 image-video 表示。
帶走什麼:影片理解可借力影像語義,但對齊順序很關鍵。
下一步:檢查 MSRVTT-QA、MSVD-QA 的 zero-shot 設定。