HF 論文速讀 2026-06-22

今天共同趨勢是用 diffusion 做真實世界超解析,並把多步生成壓到 one-step、串流與可部署。
Video Restoration 正從高畫質 diffusion,轉向 one-step、時間一致、即時串流。
今天先記三件事
- one-step diffusion 是今天 VSR 主軸
- RealBasicVSR-style synthetic degradation 成共同訓練語言
- Real-ESRGAN 仍是 blind SR 的經典基座
五篇速讀
FlashVSR:邁向即時 Diffusion-Based Streaming Video Super-Resolution
即時串流
為什麼重要:把 one-step diffusion VSR 推向 streaming,瞄準單張 A100 上的即時使用情境。
帶走什麼:重點不是只拚畫質,而是把 diffusion VSR 做到低延遲、可連續處理。
下一步:先看 TC Decoder 與 streaming 設計,評估能否接到影片管線。
DOVE:Efficient One-Step Diffusion Model for Real-World Video Super-Resolution
高效一步
為什麼重要:用 CogVideoX1.5-5B 做 one-step VSR,主打真實世界 4× upscaling 的效率。
帶走什麼:大型 video diffusion backbone 可被壓成單步推論,成為 VSR 的新路線。
下一步:比較 DOVE 與 FlashVSR 的速度、品質和部署成本。
SeedVR2:One-Step Video Restoration via Diffusion Adversarial Post-Training
對抗後訓
為什麼重要:透過 diffusion adversarial post-training,把 one-step restoration 推到 720p 4× 場景。
帶走什麼:後訓策略可能是把多步 diffusion 壓成一步、同時保住感知品質的關鍵。
下一步:關注 LPIPS、SSIM、PSNR 之間的取捨與失真案例。
Upscale-A-Video:Temporal-Consistent Diffusion Model for Real-World Video Super-…
品質標竿
為什麼重要:在 VideoLQ 與 YouHQ40 多項指標拿到 rank #1,是今日 VSR 品質基準之一。
帶走什麼:Temporal consistency 仍是 real-world VSR 的核心,不能只看單幀銳利度。
下一步:把它當作畫質上限參考,再對照 one-step 方法的效率差距。
Real-ESRGAN:用純合成資料訓練 Real-World Blind Super-Resolution
經典基座
為什麼重要:以 pure synthetic data 做 real-world blind SR,仍在多個 image SR benchmark 拿 rank #1。
帶走什麼:高品質 degradation pipeline 比真實配對資料更容易規模化,影響後續 VSR 方法。
下一步:回頭看其 degradation 與 sharpened GT 設計,理解今日 VSR 資料來源。