穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-07-06

HF 論文速讀 2026-07-06

3D 生成、影像 flow 模型與影片時空推理的 diffusion 創新

今天重點在 pixel-space 直接生成 3D Gaussian、asymmetric flow 優化影像,以及 grounded video reasoning 的 SOTA 方法。

今天先記三件事

  1. PixGS 在 GSO 3D 生成拿下 LPIPS、SSIM、PSNR 三項第一
  2. Asymmetric Flow Models 在 HPSv3 影像生成排第二,基於 FLUX.2
  3. Open-o3 Video 與 Video-STR 在 V-STaR 影片理解分別排二、三

五篇速讀

PixGS:直接在 pixel-space 生成 3D Gaussian Splat

pixel-space…

為什麼重要:單一物件 tier 在 GSO 與 T3Bench 多項指標 SOTA,LPIPS 0.123、SSIM 0.842、PSNR 21.21

帶走什麼:首次在 pixel-space 直接用 diffusion 生成 3D Gaussian Splat,省去 latent 轉換

下一步:查看 arXiv 2607.01803 Table 1,比較 T3Bench 不同 prompt tier 結果

Asymmetric Flow Models:把生成路徑設計成不對稱的 flow

asymmetric…

為什麼重要:HPSv3 1024×1024 解析度下排第二,HPSv3 Score 10.66,基於 FLUX.2 klein 微調

帶走什麼:不對稱 flow 搭配 variance reduction 與 LPIPS perceptual correction 提升生成品質

下一步:閱讀 paper Table 4,了解 3M LAION-Aesthetics 資料與 UniPC sampler 設定

Open-o3 Video:用明確時空證據做 grounded video reasoning

grounded vi…

為什麼重要:V-STaR benchmark mLGM 46.6、mAM 33.7 排第二,基於 Qwen2.5-VL-7B 經 STGR SFT+GSPO RL

帶走什麼:16 幀均勻取樣,強調 explicit spatio-temporal evidence 提升推理可信度

下一步:查看 Table 1 與 vLLM 重評估結果,比較 GPT-4o 基準

Video-STR:用 relation graph 強化影片時空推理

relation gr…

為什麼重要:V-STaR mLGM 37.8 排第三,基於 Qwen2.5-VL-7B-Instruct 以 graph-based GRPO 訓練

帶走什麼:STV-205k 資料集搭配 relation graph,提升 32 幀 448×28×28 解析度下的時空推理

下一步:閱讀 Table 1,交叉驗證與 GPT-4o、Qwen2.5-VL-7B 的 mLGM 分數差異

DiffusionSfM:用 ray origin / endpoint diffusion 預測結構與運動

ray diffusi…

為什麼重要:Re10K RRA@15 98.0 拿第一,CO3Dv2 95.3 排第二,基於 DUSt3R 資料混合訓練

帶走什麼:以 ray origin 與 endpoint diffusion 同時預測結構與運動,8 視圖輸入表現優異

下一步:參考 GitHub eval.md 與 Table 1,測試 unseen categories 的 camera rotation ac…