HF 論文速讀 2026-07-05

今日論文聚焦 3D 幾何、深度估計與高效影像/影片生成,透過 partitioning、diffusion 與 distillation 提升 scalability 與準確度。
AI 在多視角 3D 理解、單圖深度估計,以及 one-step 影像生成與 grounded video reasoning 上有多項 SOTA 突破。
今天先記三件事
- DA-VGGT 用 diversity-aware partitioning 優化 VGGT,多視角 3D 推論在 NRGBD 拿下多項…
- PointDiT 以 pixel-space diffusion 單圖估深度,在 iBims-1、NYUv2、KITTI 等 benchm…
- Nemotron-Labs 與 Cross-Space Distillation 推進高解析影像生成,VisionCoach 強化影片 g…
五篇速讀
DA-VGGT:多視角 3D 推論的智慧視圖分割
3D 視圖分割框架
為什麼重要:在 NRGBD 多項指標 SOTA,提升多視角 3D 理解的可擴展性與效率。
帶走什麼:Diversity-aware partitioning 讓 VGGT 更有效處理大量視圖與 frame。
下一步:查看 arXiv Table 20 比較不同 backbone 與 frame 數結果。
PointDiT:像素空間擴散用於單目幾何估計
單圖深度估計
為什麼重要:在 iBims-1、NYUv2、KITTI、DIODE 等 benchmark 達成多項 SOTA,零-shot 表現強。
帶走什麼:Pixel-space diffusion 搭配 scale/shift alignment 提升深度準確度。
下一步:參考 Appendix Table 8 查看 512x512 與 4-step 設定細節。
Nemotron-Labs-Diffusion-Image:高解析影像的 masked discrete diffusion
高解析影像生成
為什麼重要:HPSv3 拿下第一,使用 8B 參數與 6M 合成資料微調,131072 codebook。
帶走什麼:Masked discrete diffusion 有效推進高解析合成品質與人Preference 分數。
下一步:查看 Table 2 比較 MJHQ-30k HPSv3 結果與 baseline。
Cross-Space Distillation:多 teacher 訓練 one-step student
One-step 模型…
為什麼重要:HPSv3 第三名,平均五個 teacher(SDXL、FLUX 等)蒸餾出 0.86B one-step 模型。
帶走什麼:Cross-space distillation 讓單步生成接近多步 teacher 品質。
下一步:研究如何 merge 多個 Bridge-distilled checkpoints 提升穩定性。
VisionCoach:視覺感知 prompting 強化 grounded video reasoning
影片 grounded…
為什麼重要:V-STaR benchmark 上 mLGM 47.5 與 mAM 34.3 兩項 SOTA,提升影片理解 grounding。
帶走什麼:Visual-perception prompting 在 raw video 上強化 Chain1/Chain2 推理表現。
下一步:查看 V-STaR Table 2 了解 mean LGM 與 mean AM 計算方式。