HF 論文速讀 2026-06-21

今天共同趨勢是把多模態能力往即時部署、長上下文與 Agent 化三個方向推進。
生成式 AI 正從單點模型分數,轉向可串流、可看聽說、可長程推理與可執行任務。
今天先記三件事
- SwiftVR 把影片修復壓到一步式即時生成。
- Kimi K2 代表開放 MoE Agent 模型持續追閉源。
- Gemini 系列仍是音訊、影片、多模態長上下文基準核心。
五篇速讀
SwiftVR 即時一步式影片修復
即時修復
為什麼重要:同時在 VideoLQ 與 YouHQ40 多項影片修復指標拿到 rank #1。
帶走什麼:重點不是只修得好,而是 causal streaming、無重疊 chunk、bfloat16。
下一步:優先看其串流協定與 RealBasicVSR-style degradation。
Qwen-Image 圖像生成技術報告
圖像生成
為什麼重要:在 PRISM-Bench English-track overall average 達 rank #2。
帶走什麼:Qwen 系列把版圖延伸到圖像生成,開始進入高階生成評測競爭。
下一步:用 PRISM-Bench 細項檢查其英文圖文生成強弱。
Kimi K2 開放式 Agentic Intelligence
開放Agent
為什麼重要:開放 MoE Agent 模型,在 FRAMES 與 Livebench reasoning 進入前段班。
帶走什麼:1T 級 MoE、32B activated,主打 non-thinking mode 的可用 Agent 能力。
下一步:先看 Instruct model card,再測工具使用與長任務。
Gemini 1.5 百萬 Token 多模態理解
長上下文
為什麼重要:在 ASR、Video Understanding、speech-to-English translation 都有強基準表現。
帶走什麼:Gemini 1.5 的核心價值是百萬 token context 下的多模態理解。
下一步:關注長影片、長音訊與跨模態檢索型任務。
Gemini 原生多模態模型家族
多模態基座
為什麼重要:Gemini 原始家族仍在 CoVoST 2 與 FLEURS 音訊任務維持高排名。
帶走什麼:這篇是理解 Gemini 後續 1.5 與多模態評測脈絡的基準文件。
下一步:回看 audio evaluation 表格,對照 1.5 的能力變化。