穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-07-05

HF 論文速讀 2026-07-05

今日論文聚焦 3D 幾何、深度估計與高效影像/影片生成,透過 partitioning、diffusion 與 distillation 提升 scalability 與準確度。

AI 在多視角 3D 理解、單圖深度估計,以及 one-step 影像生成與 grounded video reasoning 上有多項 SOTA 突破。

今天先記三件事

  1. DA-VGGT 用 diversity-aware partitioning 優化 VGGT,多視角 3D 推論在 NRGBD 拿下多項…
  2. PointDiT 以 pixel-space diffusion 單圖估深度,在 iBims-1、NYUv2、KITTI 等 benchm…
  3. Nemotron-Labs 與 Cross-Space Distillation 推進高解析影像生成,VisionCoach 強化影片 g…

五篇速讀

DA-VGGT:多視角 3D 推論的智慧視圖分割

3D 視圖分割框架

為什麼重要:在 NRGBD 多項指標 SOTA,提升多視角 3D 理解的可擴展性與效率。

帶走什麼:Diversity-aware partitioning 讓 VGGT 更有效處理大量視圖與 frame。

下一步:查看 arXiv Table 20 比較不同 backbone 與 frame 數結果。

PointDiT:像素空間擴散用於單目幾何估計

單圖深度估計

為什麼重要:在 iBims-1、NYUv2、KITTI、DIODE 等 benchmark 達成多項 SOTA,零-shot 表現強。

帶走什麼:Pixel-space diffusion 搭配 scale/shift alignment 提升深度準確度。

下一步:參考 Appendix Table 8 查看 512x512 與 4-step 設定細節。

Nemotron-Labs-Diffusion-Image:高解析影像的 masked discrete diffusion

高解析影像生成

為什麼重要:HPSv3 拿下第一,使用 8B 參數與 6M 合成資料微調,131072 codebook。

帶走什麼:Masked discrete diffusion 有效推進高解析合成品質與人Preference 分數。

下一步:查看 Table 2 比較 MJHQ-30k HPSv3 結果與 baseline。

Cross-Space Distillation:多 teacher 訓練 one-step student

One-step 模型…

為什麼重要:HPSv3 第三名,平均五個 teacher(SDXL、FLUX 等)蒸餾出 0.86B one-step 模型。

帶走什麼:Cross-space distillation 讓單步生成接近多步 teacher 品質。

下一步:研究如何 merge 多個 Bridge-distilled checkpoints 提升穩定性。

VisionCoach:視覺感知 prompting 強化 grounded video reasoning

影片 grounded…

為什麼重要:V-STaR benchmark 上 mLGM 47.5 與 mAM 34.3 兩項 SOTA,提升影片理解 grounding。

帶走什麼:Visual-perception prompting 在 raw video 上強化 Chain1/Chain2 推理表現。

下一步:查看 V-STaR Table 2 了解 mean LGM 與 mean AM 計算方式。