穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-08-14

HF 論文速讀 2026-08-14

自演化代理、低成本推理與視覺/全模態落地同日衝榜

今天看點:Ouroboros 自改核心拿下電腦使用 SOTA,BDH-CQ 用小模型把 ARC 成本壓到極低,影音後訓練與全模態對話同步推進。

今天先記三件事

  1. Ouroboros 以審核 commit 自演化,OSWorld-Verified 90.69%、Terminal-Bench 2.1 8…
  2. BDH-CQ 150M 在 ARC-AGI-1 達 29.5% pass@2,每題約 $0.0007,刷新成本—準確率前沿。
  3. VidGround 視覺扎根後訓練讓 7B 模型 VideoMMMU 49.4%;LangFlow 與 Ex-Omni-2D 補齊連續 L…

五篇速讀

Ouroboros:受審核核心演化的編程代理

自演化 harness

為什麼重要:工具、prompt、上下文與核心實作靠審核 commit 迭代,直接刷新多個 agent benchmark。

帶走什麼:遞迴自由演化+經驗驅動修補;人提故障與提案,代理決定改什麼並成為後續 runtime。

下一步:先看 OSWorld/Terminal-Bench 數字與 Hope 長跑部署邏輯,再對照自家 agent 迴路。

VidGround:先看再答的視覺扎根後訓練

影片理解後訓

為什麼重要:Qwen2.5-VL-7B 在 181K VidGround 子集上 GRPO 後訓,VideoMMMU 準確率 49.4% 衝到第一。

帶走什麼:用視覺扎根的 post-training 強化「看完再答」,評估採 64 幀均勻取樣。

下一步:做 VLM 影片 QA 時優先複製 GRPO+視覺扎根資料配方與幀取樣設定。

LangFlow:連續 diffusion 語言模型

連續 LM 路線

為什麼重要:連續 diffusion 在語言建模上逼近離散路線;LM1B 驗證集 upper-bound PPL 30.0。

帶走什麼:1M steps+self-conditioning 的 LangFlow 證明連續流也能打語言建模榜,非生成 PPL。

下一步:若研究 diffusion LM,對照 Table 2 的 upper-bound 設定,勿與 generative PPL 混比。

BDH-CQ:循環潛在推理的情境學習

低成本推理

為什麼重要:推理時持續更新循環記憶,在高維潛空間迭代求解,不必口語化中間步驟。

帶走什麼:150M 在 ARC-AGI-1 公開評測 29.5% pass@2,約 $0.0007/題,突破既有成本—準確率 Pareto。

下一步:做 in-context/抽象推理時優先評估 latent recurrent 與極低推論成本操作點。

Ex-Omni-2D:帶原生視覺存在感的全模態對話

全模態對話

為什麼重要:一次產出文字、個人化語音與參考條件影片,讓回覆不再「有聲無影」。

帶走什麼:VTP 規劃場景情緒動作;多 codebook 語音單元當聲—時介面,Teacher 蒸餾成少步串流 Student。

下一步:做虛擬形象對話時對齊 VTP+共享語音介面與四步串流推論架構。