HF 速讀AI 論文
HF 論文速讀 2026-06-15

今天共同趨勢是:模型不只變大,而是把資料、模態、長序列與協作方式一起系統化。
AI 進展正在從單點模型能力,轉向開放資料、跨模態與多 Agent 協作的完整系統。
今天先記三件事
- Molmo2 把開放 VLM 推到圖像與影片理解前段班。
- HAT、xLSTM 顯示舊架構仍能靠設計重回競爭。
- Orchestra-o1 指向全模態多 Agent 編排新需求。
五篇速讀
Molmo2:開放權重與資料的 VLM 教學簡報
開放VLM
為什麼重要:同時主打開放權重與資料,且在圖像、影片理解榜單很強。
帶走什麼:開放式 VLM 正往多影格影片理解與 grounding 能力整合。
下一步:先看資料配方、frame 設定與各 benchmark 評測。
HAT:讓更多像素被 Transformer 看見
SR骨幹
為什麼重要:在多個 2x image super-resolution benchmark 拿到 rank #1。
帶走什麼:提升 Transformer 影像復原效果,關鍵在啟用更多像素互動。
下一步:做超解析任務可對照 HAT-L、DF2K 與 Y-channel PSNR。
XLM-V:突破多語詞彙瓶頸
多語MLM
為什麼重要:針對 multilingual masked LM 的 vocabulary bottleneck 提出解法。
帶走什麼:多語模型不只看參數量,詞彙表設計會限制跨語遷移。
下一步:關注 TyDiQA、WikiANN、MasakhaNER 的 cross-lingual 設定。
xLSTM:把 LSTM 擴展回大模型競賽
序列架構
為什麼重要:把 LSTM 擴展後,在 WikiText-103 perplexity 榜單進前段。
帶走什麼:語言模型架構不只有 Transformer,循環式設計仍有探索價值。
下一步:比較 xLSTM 與 Transformer 在長序列、訓練成本上的取捨。
Orchestra-o1:全模態 Agent 編隊指揮
Agent編排
為什麼重要:把多 Agent 編排擴展到文字、影像、音訊、影片等全模態任務。
帶走什麼:下一波 Agent 難點是 modality-aware 拆解、專精與平行執行。
下一步:先看 OmniGAIA 評測與任務拆解機制是否可遷移。