穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-07-13

HF 論文速讀 2026-07-13

生成模型預訓練正重塑視覺學習與長程代理評估

影片生成模型可轉為通用視覺學習器,長程終端基準與 LLM 知識應用差距研究同步推進。

今天先記三件事

  1. 長程終端任務需密集中間獎勵捕捉代理進展
  2. 影片生成 backbone 在多視覺任務達 SOTA
  3. LLM 存在 Knowing-Using Gap,知識路由是關鍵

五篇速讀

Long-Horizon-Terminal-Bench:長程終端任務的密集評分基準

長程代理基準

為什麼重要:現有基準太簡單只看最終結果,忽略中間進度與部分解法

帶走什麼:46 項長程任務涵蓋九類別,支援密集子任務評分與部分給分

下一步:關注代理在數百 episodes 長時程規劃與除錯表現

GenCeption:影片生成模型也能做通用視覺學習

視覺學習新範式

為什麼重要:影片生成預訓練提供時空先驗與視覺語言對齊,勝過專用模型

帶走什麼:GenCeption 在深度、法線、姿態、分割等多任務達 SOTA

下一步:測試影片生成 backbone 作為視覺感知 feed-forward 模型

ReChannel:從 RGB 生成改成 pixel-space dense field 讀出

Dense 預測新方法

為什麼重要:現有方法把 dense prediction 當成生成,繼承不必要 RGB 介面

帶走什麼:保留 VAE encoder、適配 DiT 並用 token-local head 直接讀出 pixel 場

下一步:在 pixel-space 讀出任務原生數量而非生成新 RGB 內容

Knowing–Using Gap:為何 LLM 記住知識卻不會用

微調機制診斷

為什麼重要:模型快速記住新事實卻無法用於下游推理,存在時間落差

帶走什麼:self-patching 找出知識電路 misalignment,啟發式策略恢復 58-75% 差距

下一步:監控知識在內部層的滲透動態與路由有效性

Soofi S 30B-A3B:德英雙語主權開源基礎模型

主權開源模型

為什麼重要:混合 Mamba Transformer 只激活 3B 參數,長上下文吞吐優勢明顯

帶走什麼:27 兆 token 預訓練,在英德基準與程式碼任務領先多個更大模型

下一步:關注德國工業 AI 雲上端到端主權模型釋出細節