HF 論文速讀 2026-08-14

自演化代理、低成本推理與視覺/全模態落地同日衝榜
今天看點:Ouroboros 自改核心拿下電腦使用 SOTA,BDH-CQ 用小模型把 ARC 成本壓到極低,影音後訓練與全模態對話同步推進。
今天先記三件事
- Ouroboros 以審核 commit 自演化,OSWorld-Verified 90.69%、Terminal-Bench 2.1 8…
- BDH-CQ 150M 在 ARC-AGI-1 達 29.5% pass@2,每題約 $0.0007,刷新成本—準確率前沿。
- VidGround 視覺扎根後訓練讓 7B 模型 VideoMMMU 49.4%;LangFlow 與 Ex-Omni-2D 補齊連續 L…
五篇速讀
Ouroboros:受審核核心演化的編程代理
自演化 harness
為什麼重要:工具、prompt、上下文與核心實作靠審核 commit 迭代,直接刷新多個 agent benchmark。
帶走什麼:遞迴自由演化+經驗驅動修補;人提故障與提案,代理決定改什麼並成為後續 runtime。
下一步:先看 OSWorld/Terminal-Bench 數字與 Hope 長跑部署邏輯,再對照自家 agent 迴路。
VidGround:先看再答的視覺扎根後訓練
影片理解後訓
為什麼重要:Qwen2.5-VL-7B 在 181K VidGround 子集上 GRPO 後訓,VideoMMMU 準確率 49.4% 衝到第一。
帶走什麼:用視覺扎根的 post-training 強化「看完再答」,評估採 64 幀均勻取樣。
下一步:做 VLM 影片 QA 時優先複製 GRPO+視覺扎根資料配方與幀取樣設定。
LangFlow:連續 diffusion 語言模型
連續 LM 路線
為什麼重要:連續 diffusion 在語言建模上逼近離散路線;LM1B 驗證集 upper-bound PPL 30.0。
帶走什麼:1M steps+self-conditioning 的 LangFlow 證明連續流也能打語言建模榜,非生成 PPL。
下一步:若研究 diffusion LM,對照 Table 2 的 upper-bound 設定,勿與 generative PPL 混比。
BDH-CQ:循環潛在推理的情境學習
低成本推理
為什麼重要:推理時持續更新循環記憶,在高維潛空間迭代求解,不必口語化中間步驟。
帶走什麼:150M 在 ARC-AGI-1 公開評測 29.5% pass@2,約 $0.0007/題,突破既有成本—準確率 Pareto。
下一步:做 in-context/抽象推理時優先評估 latent recurrent 與極低推論成本操作點。
Ex-Omni-2D:帶原生視覺存在感的全模態對話
全模態對話
為什麼重要:一次產出文字、個人化語音與參考條件影片,讓回覆不再「有聲無影」。
帶走什麼:VTP 規劃場景情緒動作;多 codebook 語音單元當聲—時介面,Teacher 蒸餾成少步串流 Student。
下一步:做虛擬形象對話時對齊 VTP+共享語音介面與四步串流推論架構。