穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-06-15

HF 論文速讀 2026-06-15

今天共同趨勢是:模型不只變大,而是把資料、模態、長序列與協作方式一起系統化。

AI 進展正在從單點模型能力,轉向開放資料、跨模態與多 Agent 協作的完整系統。

今天先記三件事

  1. Molmo2 把開放 VLM 推到圖像與影片理解前段班。
  2. HAT、xLSTM 顯示舊架構仍能靠設計重回競爭。
  3. Orchestra-o1 指向全模態多 Agent 編排新需求。

五篇速讀

Molmo2:開放權重與資料的 VLM 教學簡報

開放VLM

為什麼重要:同時主打開放權重與資料,且在圖像、影片理解榜單很強。

帶走什麼:開放式 VLM 正往多影格影片理解與 grounding 能力整合。

下一步:先看資料配方、frame 設定與各 benchmark 評測。

HAT:讓更多像素被 Transformer 看見

SR骨幹

為什麼重要:在多個 2x image super-resolution benchmark 拿到 rank #1。

帶走什麼:提升 Transformer 影像復原效果,關鍵在啟用更多像素互動。

下一步:做超解析任務可對照 HAT-L、DF2K 與 Y-channel PSNR。

XLM-V:突破多語詞彙瓶頸

多語MLM

為什麼重要:針對 multilingual masked LM 的 vocabulary bottleneck 提出解法。

帶走什麼:多語模型不只看參數量,詞彙表設計會限制跨語遷移。

下一步:關注 TyDiQA、WikiANN、MasakhaNER 的 cross-lingual 設定。

xLSTM:把 LSTM 擴展回大模型競賽

序列架構

為什麼重要:把 LSTM 擴展後,在 WikiText-103 perplexity 榜單進前段。

帶走什麼:語言模型架構不只有 Transformer,循環式設計仍有探索價值。

下一步:比較 xLSTM 與 Transformer 在長序列、訓練成本上的取捨。

Orchestra-o1:全模態 Agent 編隊指揮

Agent編排

為什麼重要:把多 Agent 編排擴展到文字、影像、音訊、影片等全模態任務。

帶走什麼:下一波 Agent 難點是 modality-aware 拆解、專精與平行執行。

下一步:先看 OmniGAIA 評測與任務拆解機制是否可遷移。