穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-08-16

HF 論文速讀 2026-08-16

講者驗證狂刷 VoxCeleb SOTA,外加即時自回歸影片外推與檢索增強仇恨迷因偵測。

今天主軸是 Speaker Verification 多模型改寫 VoxCeleb;另有 RAVEN 用 CM-GRPO 做即時影片外推,以及 LMM 檢索增強仇恨迷因偵測登頂。

今天先記三件事

  1. w2v-BERT 2.0 + KD 結構化剪枝在 VoxCeleb1-H/E/O 與 CN-Celeb 多項 rank #1。
  2. RAVEN 用 interleaved clean/noisy 對齊訓練與推論,並以 CM-GRPO 直接 RL 一致性核。
  3. ReDimNet2 與開源工具 Kiwano 持續把 clean protocol EER 壓到約 1% 以下。

五篇速讀

RAVEN:即時自回歸影片外推與 Consistency-model GRPO

影片生成方法

為什麼重要:補上 causal AR video diffusion 訓練/推論 history 分布落差,並提出 CM-GRPO 做 few-step 強化。

帶走什麼:把 self-rollout 交錯成 clean endpoint 與 noisy state,讓下游 chunk loss 監督 history;VBench Semantic…

下一步:做串流/長時域 video extrapolation 時優先對齊 train-test history,並評估 CM-GRPO 是否可取…

ReDimNet2:以 Time-Pooled Dimension Reshaping 擴展講者驗證

輕量 SV 架構

為什麼重要:用 time-pooled 維度重塑擴展網路,在 clean VoxCeleb 協定取得高名次且參數量可控。

帶走什麼:ReDimNet2-B6 約 12.3M、13.05 GMACs;Vox1-H/E/O clean EER 0.99/0.52/0.29,SphereFace2-C 預訓練加大…

下一步:資源有限的 SV 部署可對標 B6 設定與 VoxCeleb2-dev 訓練配方,直接比 cosine、無 score norm。

Kiwano:開源講者驗證工具包

SV 工程底座

為什麼重要:把 checkpoint averaging、large-margin FT、CMF、adaptive s-norm、QMF 整成可複現 pipeline。

帶走什麼:fwSE-ResNet-200 完整 refinement 後 Vox1-H clean EER 0.92、minDCF 0.086;Vox1-O EER 0.34、minDCF…

下一步:要复現 SOTA 後處理鏈時直接跟 Kiwano 全流程,統一 P_target=0.01 與 C_miss=C_fa=1。

w2v-BERT 2.0 與知識蒸餾導向結構化剪枝強化講者驗證

今日 SV 頂峰

為什麼重要:自監督骨幹加 LoRA/MFA 與 KD 結構化剪枝,在多個 clean/multi-enrollment 榜單 rank #1。

帶走什麼:Vox1-H/E/O EER 0.55/0.27/0.12;CN-Celeb multi-enroll EER 4.67;訓練含 VoxCeleb2+VoxBlink2 與 sc…

下一步:追絕對 SOTA 先讀此 pipeline;注意額外公開數據與 large-margin FT、校準對 EER/minDCF 的貢獻。

以檢索增強穩健適配大型多模態模型做仇恨迷因偵測

多模態安全

為什麼重要:把 LMM 適配成 retrieval-augmented hateful meme 偵測,supervised 設定登頂 Hateful Memes。

帶走什麼:兩階段 RA-HMD fine-tuning 搭配 LRC inference,test_seen ROC-AUC 91.1、rank #1。

下一步:內容審核/迷因理解可復用 retrieval + 兩階段 FT + LRC;以 AUC 為主指標對照 test_seen。