HF 速讀AI 論文
HF 論文速讀 2026-07-13

生成模型預訓練正重塑視覺學習與長程代理評估
影片生成模型可轉為通用視覺學習器,長程終端基準與 LLM 知識應用差距研究同步推進。
今天先記三件事
- 長程終端任務需密集中間獎勵捕捉代理進展
- 影片生成 backbone 在多視覺任務達 SOTA
- LLM 存在 Knowing-Using Gap,知識路由是關鍵
五篇速讀
Long-Horizon-Terminal-Bench:長程終端任務的密集評分基準
長程代理基準
為什麼重要:現有基準太簡單只看最終結果,忽略中間進度與部分解法
帶走什麼:46 項長程任務涵蓋九類別,支援密集子任務評分與部分給分
下一步:關注代理在數百 episodes 長時程規劃與除錯表現
GenCeption:影片生成模型也能做通用視覺學習
視覺學習新範式
為什麼重要:影片生成預訓練提供時空先驗與視覺語言對齊,勝過專用模型
帶走什麼:GenCeption 在深度、法線、姿態、分割等多任務達 SOTA
下一步:測試影片生成 backbone 作為視覺感知 feed-forward 模型
ReChannel:從 RGB 生成改成 pixel-space dense field 讀出
Dense 預測新方法
為什麼重要:現有方法把 dense prediction 當成生成,繼承不必要 RGB 介面
帶走什麼:保留 VAE encoder、適配 DiT 並用 token-local head 直接讀出 pixel 場
下一步:在 pixel-space 讀出任務原生數量而非生成新 RGB 內容
Knowing–Using Gap:為何 LLM 記住知識卻不會用
微調機制診斷
為什麼重要:模型快速記住新事實卻無法用於下游推理,存在時間落差
帶走什麼:self-patching 找出知識電路 misalignment,啟發式策略恢復 58-75% 差距
下一步:監控知識在內部層的滲透動態與路由有效性
Soofi S 30B-A3B:德英雙語主權開源基礎模型
主權開源模型
為什麼重要:混合 Mamba Transformer 只激活 3B 參數,長上下文吞吐優勢明顯
帶走什麼:27 兆 token 預訓練,在英德基準與程式碼任務領先多個更大模型
下一步:關注德國工業 AI 雲上端到端主權模型釋出細節