HF 論文速讀 2026-07-06

3D 生成、影像 flow 模型與影片時空推理的 diffusion 創新
今天重點在 pixel-space 直接生成 3D Gaussian、asymmetric flow 優化影像,以及 grounded video reasoning 的 SOTA 方法。
今天先記三件事
- PixGS 在 GSO 3D 生成拿下 LPIPS、SSIM、PSNR 三項第一
- Asymmetric Flow Models 在 HPSv3 影像生成排第二,基於 FLUX.2
- Open-o3 Video 與 Video-STR 在 V-STaR 影片理解分別排二、三
五篇速讀
PixGS:直接在 pixel-space 生成 3D Gaussian Splat
pixel-space…
為什麼重要:單一物件 tier 在 GSO 與 T3Bench 多項指標 SOTA,LPIPS 0.123、SSIM 0.842、PSNR 21.21
帶走什麼:首次在 pixel-space 直接用 diffusion 生成 3D Gaussian Splat,省去 latent 轉換
下一步:查看 arXiv 2607.01803 Table 1,比較 T3Bench 不同 prompt tier 結果
Asymmetric Flow Models:把生成路徑設計成不對稱的 flow
asymmetric…
為什麼重要:HPSv3 1024×1024 解析度下排第二,HPSv3 Score 10.66,基於 FLUX.2 klein 微調
帶走什麼:不對稱 flow 搭配 variance reduction 與 LPIPS perceptual correction 提升生成品質
下一步:閱讀 paper Table 4,了解 3M LAION-Aesthetics 資料與 UniPC sampler 設定
Open-o3 Video:用明確時空證據做 grounded video reasoning
grounded vi…
為什麼重要:V-STaR benchmark mLGM 46.6、mAM 33.7 排第二,基於 Qwen2.5-VL-7B 經 STGR SFT+GSPO RL
帶走什麼:16 幀均勻取樣,強調 explicit spatio-temporal evidence 提升推理可信度
下一步:查看 Table 1 與 vLLM 重評估結果,比較 GPT-4o 基準
Video-STR:用 relation graph 強化影片時空推理
relation gr…
為什麼重要:V-STaR mLGM 37.8 排第三,基於 Qwen2.5-VL-7B-Instruct 以 graph-based GRPO 訓練
帶走什麼:STV-205k 資料集搭配 relation graph,提升 32 幀 448×28×28 解析度下的時空推理
下一步:閱讀 Table 1,交叉驗證與 GPT-4o、Qwen2.5-VL-7B 的 mLGM 分數差異
DiffusionSfM:用 ray origin / endpoint diffusion 預測結構與運動
ray diffusi…
為什麼重要:Re10K RRA@15 98.0 拿第一,CO3Dv2 95.3 排第二,基於 DUSt3R 資料混合訓練
帶走什麼:以 ray origin 與 endpoint diffusion 同時預測結構與運動,8 視圖輸入表現優異
下一步:參考 GitHub eval.md 與 Table 1,測試 unseen categories 的 camera rotation ac…