穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-08-12

HF 論文速讀 2026-08-12

自我演化代理、低成本潛在推理與全模態具身對話同步推進,效率與閉環成為主軸。

今天重點:會改自己程式的 coding agent 刷榜、百兆級潛在推理破 ARC 成本前沿,全模態開始長出身體。

今天先記三件事

  1. Ouroboros 以審核式 commit 自我演化,OSWorld-Verified 90.69%、Terminal-Bench 2.1…
  2. BDH-CQ 150M 在 ARC-AGI-1 達 29.5% pass@2,單題約 $0.0007,重寫成本-精度 Pareto。
  3. Ex-Omni-2D 用 Visual Thought Plan 同步輸出文字、個性語音與參考條件影片頭像。

五篇速讀

Ouroboros:審核式核心演化的自我發展前沿 Coding Agent

自我演化 agent

為什麼重要:工具、prompt、context 與核心實作經審核 commit 成為後續 runtime,並在多項 computer-use/bench 報 SOTA。

帶走什麼:遞迴自由演化與經驗驅動演化並行;人類提故障與提案,agent 決定改什麼,Hope 已公開運行 161 天。

下一步:先看 OSWorld/Terminal-Bench 數字與治理審核流程,再對照自家 agent harness 能否閉環改核。

Watch Before You Answer:從視覺 grounding 的後訓練學習

影片理解後訓

為什麼重要:以視覺 grounded 後訓練拉高 VideoMMMU,signals 報 rank #1、Accuracy 49.4。

帶走什麼:Qwen2.5-VL-7B 在 181K VidGround 子集上 GRPO 後訓,評估用 64 幀均勻採樣。

下一步:做 VLM 後訓時優先補視覺 grounding 資料與 GRPO,並對齊 VideoMMMU 設定複現。

LangFlow:連續擴散在語言模型上媲美離散路線

連續擴散 LM

為什麼重要:證明 continuous diffusion 可在語言建模上逼近 discrete 路線,LM1B 相關指標進入前列。

帶走什麼:LM1B 訓練 1M steps 加 self-conditioning,validation-set upper bound Perplexity=30.0(非 generat…

下一步:讀 Table 2 分清 upper-bound 與 generative PPL,評估是否把 diffusion LM 納入實驗對照。

BDH-CQ:結合 In-Context Learning 的遞迴潛在推理

低成本推理

為什麼重要:推理時持續更新 recurrent memory,在高維 latent 迭代求解且不口頭化中間步驟,成本效率突出。

帶走什麼:150M 在公開 ARC-AGI-1 達 29.5% pass@2、約 $0.0007/task,突破既有成本-精度前沿。

下一步:若在意 $/accuracy,精讀 ARC 干預實驗與 pass@2 設定,評估 latent recurrent ICL 可移植性。

Ex-Omni-2D:具原生視覺存在感的表現型全模態對話模型

全模態具身

為什麼重要:補上 omni 對話長期「有聲無身」缺口,一次協調文字、個性語音與參考條件影片。

帶走什麼:先預測 VTP(場景/情緒/動作),再以 multi-codebook speech units 對齊語音與影片;Teacher 蒸餾成少步 Streaming Student。

下一步:做數字人/語音對話產品時對齊 VTP 與 prefix streaming,避免強依賴齊全四元監督資料。