穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-08-17

HF 論文速讀 2026-08-17

情緒理解從單一模態分類走向以多模態、外部資料與訓練策略共同提升的系統化競賽。

今天的核心是:情緒辨識 SOTA 不只靠更大模型,更靠資料、上下文、模態融合與可靠評測設計。

今天先記三件事

  1. PRC-Emo 以檢索、提示解讀與課程學習,同登 MELD、IEMOCAP 第一。
  2. 視覺情緒辨識正混用靜態與動態資料;S4D 在 MAFW 取得 UAR 43.72、WAR 58.44。
  3. TabPFN-3 顯示 tabular foundation model 已進入即時排行榜競爭,但仍需看跨資料集穩定性。

五篇速讀

TabPFN-3 技術報告

表格學習競逐者

為什麼重要:在 TabArena-v0.1 的 51 個資料集、全任務設定排名第三,Elo 為 1642。

帶走什麼:評估不應只看單一資料集;TabPFN-3 的平均排名、調和排名與推論速度都值得一起看。

下一步:若做 tabular baseline,先以其公開 TabArena 設定對照自己的資料與硬體。

LLM 會感受嗎?用提示、檢索與課程學習教會情緒辨識

文字情緒辨識

為什麼重要:PRC-Emo 在 MELD 與 IEMOCAP 兩項 ERC 榜單皆居第一,且訓練管線與資料已公開。

帶走什麼:情緒辨識可將對話上下文、說話者特徵、顯隱式情緒解讀與相似案例檢索結合。

下一步:先讀 Table 2 與官方 repo,重點拆解 Top-3 retrieval、rank-32 LoRA 與課程排程。

以靜制動:用靜態表情資料深化動態臉部表情理解

動態視覺表情

為什麼重要:S4D 在 MAFW 11 類純視覺任務第一,使用 ViT-B/16 與 Mixture of Adapter Experts。

帶走什麼:靜態臉部表情資料不是次等訊號;與動態影片聯合微調可補足動態資料的不足。

下一步:若做影片情緒辨識,檢查是否能加入 AffectNet 類靜態資料,並重現五折聚合評測。

Emotion-LLaMA:以指令微調進行情緒多模態辨識與推理

多模態情緒推理

為什麼重要:在 MER2024-NOISE 與 MER2023-SEMI 均為第一,整合 audio、video、text 三種訊號。

帶走什麼:凍結感知編碼器、只以 LoRA 調整語言骨幹,能以較少可訓練參數完成多模態對齊。

下一步:先確認 checkpoint 是否含多模態元件;不要把通用 LlamaForCausalLM 權重當成完整復現。

POSTER++:更簡潔且更強的臉部表情辨識網路

靜態表情基線

為什麼重要:POSTER++ 在 CAER-S 七類靜態情緒任務達 93.00% Accuracy,並利用臉部與場景脈絡。

帶走什麼:情緒不只存在於臉;完整畫面中的人物、場景與互動線索可顯著提升分類。

下一步:建立靜態影像 baseline 時,保留全畫面 context,並對照 ir50 與 landmark 設計。