HF 論文速讀 2026-07-21

今天焦點是以更有效率的 Diffusion、輕量 Attention 與大規模真實資料,讓視覺與機器人系統從「能做」走向「可部署、可擴展」。
最值得記住的是:真實世界資料規模、時空一致性與單步推論,正同時推動機器人和影片復原邁向實用化。
今天先記三件事
- Xiaomi-Robotics-1 用超過 10 萬小時真實軌跡,驗證 VLA 隨資料與模型擴大而提升。
- Video super-resolution 的競爭轉向凍結大模型微調、時空一致性與單步生成效率。
- LWGANet 證明輕量 Group Attention 也能在遙測變遷偵測與語意分割取得強勢成績。
五篇速讀
Xiaomi-Robotics-1:以逾 10 萬小時真實軌跡擴展 Vision-Language-Action 模型
具身 AI 主線
為什麼重要:它將真實世界操作資料擴至逾 10 萬小時,並提出從預訓練到後訓練的 VLA 擴展配方。
帶走什麼:機器人能力不只靠更大模型,也依賴高品質、大規模、可語言對齊的真實操作軌跡。
下一步:優先看兩階段訓練與自動標註流程,評估能否遷移到你的機器人資料管線。
LiteVSR:以輕量 Adapter 適配凍結 Diffusion Transformer 的影片超解析
高效超解析
為什麼重要:以 Wan2.2-5B 搭配 Adapter 做 Video SR,在 YouHQ40 的 MUSIQ 取得第一名訊號。
帶走什麼:不必從頭訓練大型生成模型;凍結主幹、只訓練適配層,是降低 Video SR 成本的可行路徑。
下一步:比較 Adapter 參數量、採樣步數與畫質增益,特別檢查真實影片上的穩定性。
STCDiT:兼顧空間與時間一致性的 Diffusion Transformer 影片超解析
時序穩定派
為什麼重要:在 UDM10 的 4× RealBasicVSR degradation 評測中,SSIM 0.8451、PSNR 28.59 均列第二。
帶走什麼:影片復原不能只逐幀變清楚;跨影格的一致性是避免閃爍、維持可看性的核心條件。
下一步:讀模型如何處理時空關係,並以長鏡頭、快速運動與遮擋場景測試閃爍問題。
LWGANet:面向遙測視覺任務的輕量 Group Attention Backbone
遙測輕量骨幹
為什麼重要:在 SYSU-CD 與 WHU-CD 的變遷偵測 F1 取得第一名訊號,也在 LEVIR-CD、LoveDA 表現突出。
帶走什麼:遙測任務未必需要最龐大的 Transformer;針對群組注意力設計的輕量骨幹可兼顧效能與部署性。
下一步:若要重現,先確認 WHU-CD 的切分差異;論文未公開精確 split manifest,需避免不公平比較。
SeedVR2:以 Diffusion Adversarial Post-Training 實現單步影片復原
單步復原
為什麼重要:它主打 one-step inference,在 YouHQ40 的 DISTS 第一、NIQE 第二,兼顧感知品質與速度方向。
帶走什麼:把 Diffusion 壓縮到單一步驟,是讓高品質影片復原更接近即時或大規模處理的重要策略。
下一步:關注單步結果是否保留時序一致性,並在非合成退化、壓縮與低光影片上驗證泛化。