穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-06-22

HF 論文速讀 2026-06-22

今天共同趨勢是用 diffusion 做真實世界超解析,並把多步生成壓到 one-step、串流與可部署。

Video Restoration 正從高畫質 diffusion,轉向 one-step、時間一致、即時串流。

今天先記三件事

  1. one-step diffusion 是今天 VSR 主軸
  2. RealBasicVSR-style synthetic degradation 成共同訓練語言
  3. Real-ESRGAN 仍是 blind SR 的經典基座

五篇速讀

FlashVSR:邁向即時 Diffusion-Based Streaming Video Super-Resolution

即時串流

為什麼重要:把 one-step diffusion VSR 推向 streaming,瞄準單張 A100 上的即時使用情境。

帶走什麼:重點不是只拚畫質,而是把 diffusion VSR 做到低延遲、可連續處理。

下一步:先看 TC Decoder 與 streaming 設計,評估能否接到影片管線。

DOVE:Efficient One-Step Diffusion Model for Real-World Video Super-Resolution

高效一步

為什麼重要:用 CogVideoX1.5-5B 做 one-step VSR,主打真實世界 4× upscaling 的效率。

帶走什麼:大型 video diffusion backbone 可被壓成單步推論,成為 VSR 的新路線。

下一步:比較 DOVE 與 FlashVSR 的速度、品質和部署成本。

SeedVR2:One-Step Video Restoration via Diffusion Adversarial Post-Training

對抗後訓

為什麼重要:透過 diffusion adversarial post-training,把 one-step restoration 推到 720p 4× 場景。

帶走什麼:後訓策略可能是把多步 diffusion 壓成一步、同時保住感知品質的關鍵。

下一步:關注 LPIPS、SSIM、PSNR 之間的取捨與失真案例。

Upscale-A-Video:Temporal-Consistent Diffusion Model for Real-World Video Super-…

品質標竿

為什麼重要:在 VideoLQ 與 YouHQ40 多項指標拿到 rank #1,是今日 VSR 品質基準之一。

帶走什麼:Temporal consistency 仍是 real-world VSR 的核心,不能只看單幀銳利度。

下一步:把它當作畫質上限參考,再對照 one-step 方法的效率差距。

Real-ESRGAN:用純合成資料訓練 Real-World Blind Super-Resolution

經典基座

為什麼重要:以 pure synthetic data 做 real-world blind SR,仍在多個 image SR benchmark 拿 rank #1。

帶走什麼:高品質 degradation pipeline 比真實配對資料更容易規模化,影響後續 VSR 方法。

下一步:回頭看其 degradation 與 sharpened GT 設計,理解今日 VSR 資料來源。