穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-06-21

HF 論文速讀 2026-06-21

今天共同趨勢是把多模態能力往即時部署、長上下文與 Agent 化三個方向推進。

生成式 AI 正從單點模型分數,轉向可串流、可看聽說、可長程推理與可執行任務。

今天先記三件事

  1. SwiftVR 把影片修復壓到一步式即時生成。
  2. Kimi K2 代表開放 MoE Agent 模型持續追閉源。
  3. Gemini 系列仍是音訊、影片、多模態長上下文基準核心。

五篇速讀

SwiftVR 即時一步式影片修復

即時修復

為什麼重要:同時在 VideoLQ 與 YouHQ40 多項影片修復指標拿到 rank #1。

帶走什麼:重點不是只修得好,而是 causal streaming、無重疊 chunk、bfloat16。

下一步:優先看其串流協定與 RealBasicVSR-style degradation。

Qwen-Image 圖像生成技術報告

圖像生成

為什麼重要:在 PRISM-Bench English-track overall average 達 rank #2。

帶走什麼:Qwen 系列把版圖延伸到圖像生成,開始進入高階生成評測競爭。

下一步:用 PRISM-Bench 細項檢查其英文圖文生成強弱。

Kimi K2 開放式 Agentic Intelligence

開放Agent

為什麼重要:開放 MoE Agent 模型,在 FRAMES 與 Livebench reasoning 進入前段班。

帶走什麼:1T 級 MoE、32B activated,主打 non-thinking mode 的可用 Agent 能力。

下一步:先看 Instruct model card,再測工具使用與長任務。

Gemini 1.5 百萬 Token 多模態理解

長上下文

為什麼重要:在 ASR、Video Understanding、speech-to-English translation 都有強基準表現。

帶走什麼:Gemini 1.5 的核心價值是百萬 token context 下的多模態理解。

下一步:關注長影片、長音訊與跨模態檢索型任務。

Gemini 原生多模態模型家族

多模態基座

為什麼重要:Gemini 原始家族仍在 CoVoST 2 與 FLEURS 音訊任務維持高排名。

帶走什麼:這篇是理解 Gemini 後續 1.5 與多模態評測脈絡的基準文件。

下一步:回看 audio evaluation 表格,對照 1.5 的能力變化。