穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-06-14

HF 論文速讀 2026-06-14

多模態模型正在從離線理解走向即時互動、少步生成與可擴展空間推理。

今天重點是:生成模型不只會產圖,還開始學會深度、即時聆聽與跨影像影片理解。

今天先記三件事

  1. T2I spatial prior 可轉成強深度估計能力
  2. Audio model 正走向 always-on 即時互動
  3. 少步 diffusion 逼近高品質生成更成熟

五篇速讀

Modality Forcing:把影像生成變成深度感知預訓練

空間生成

為什麼重要:用單一 DiT 和稀疏深度資料,聯合生成 image-depth。

帶走什麼:T2I 的 spatial prior 可隨模型與資料規模轉成深度能力。

下一步:關注其在 DIODE、ScanNet、KITTI 的泛化表現。

Audio Interaction Model:讓語音模型邊聽邊決定何時回應

即時語音

為什麼重要:把離線 LALM 推向 always-on perceive-decide-respond。

帶走什麼:關鍵不只是聽懂語音,而是何時主動介入與回應。

下一步:優先看 SoundFlow、StreamAudio-2M 與推理設計。

Z-Image Turbo++:把高品質影像生成壓到 2 步

快速生圖

為什麼重要:針對 2-step generation 設計蒸餾與訓練策略。

帶走什麼:用 teacher-aligned adversarial target 可縮小 2 步品質落差。

下一步:比較 2-step 與 8-step teacher 的畫質與延遲取捨。

MatCha:讓視覺語言模型真的讀懂圖表與數學

圖表理解

為什麼重要:把 math reasoning 與 chart derendering 放進 VLP。

帶走什麼:圖表任務需要結構還原,不只是一般 OCR 或 caption。

下一步:看 PlotQA 評估設定與 5% numerical tolerance。

Video-LLaVA:先對齊再投影,統一影像與影片表示

影音對齊

為什麼重要:主張先 alignment before projection 統一 image-video 表示。

帶走什麼:影片理解可借力影像語義,但對齊順序很關鍵。

下一步:檢查 MSRVTT-QA、MSVD-QA 的 zero-shot 設定。