HF 論文速讀 2026-08-12

自我演化代理、低成本潛在推理與全模態具身對話同步推進,效率與閉環成為主軸。
今天重點:會改自己程式的 coding agent 刷榜、百兆級潛在推理破 ARC 成本前沿,全模態開始長出身體。
今天先記三件事
- Ouroboros 以審核式 commit 自我演化,OSWorld-Verified 90.69%、Terminal-Bench 2.1…
- BDH-CQ 150M 在 ARC-AGI-1 達 29.5% pass@2,單題約 $0.0007,重寫成本-精度 Pareto。
- Ex-Omni-2D 用 Visual Thought Plan 同步輸出文字、個性語音與參考條件影片頭像。
五篇速讀
Ouroboros:審核式核心演化的自我發展前沿 Coding Agent
自我演化 agent
為什麼重要:工具、prompt、context 與核心實作經審核 commit 成為後續 runtime,並在多項 computer-use/bench 報 SOTA。
帶走什麼:遞迴自由演化與經驗驅動演化並行;人類提故障與提案,agent 決定改什麼,Hope 已公開運行 161 天。
下一步:先看 OSWorld/Terminal-Bench 數字與治理審核流程,再對照自家 agent harness 能否閉環改核。
Watch Before You Answer:從視覺 grounding 的後訓練學習
影片理解後訓
為什麼重要:以視覺 grounded 後訓練拉高 VideoMMMU,signals 報 rank #1、Accuracy 49.4。
帶走什麼:Qwen2.5-VL-7B 在 181K VidGround 子集上 GRPO 後訓,評估用 64 幀均勻採樣。
下一步:做 VLM 後訓時優先補視覺 grounding 資料與 GRPO,並對齊 VideoMMMU 設定複現。
LangFlow:連續擴散在語言模型上媲美離散路線
連續擴散 LM
為什麼重要:證明 continuous diffusion 可在語言建模上逼近 discrete 路線,LM1B 相關指標進入前列。
帶走什麼:LM1B 訓練 1M steps 加 self-conditioning,validation-set upper bound Perplexity=30.0(非 generat…
下一步:讀 Table 2 分清 upper-bound 與 generative PPL,評估是否把 diffusion LM 納入實驗對照。
BDH-CQ:結合 In-Context Learning 的遞迴潛在推理
低成本推理
為什麼重要:推理時持續更新 recurrent memory,在高維 latent 迭代求解且不口頭化中間步驟,成本效率突出。
帶走什麼:150M 在公開 ARC-AGI-1 達 29.5% pass@2、約 $0.0007/task,突破既有成本-精度前沿。
下一步:若在意 $/accuracy,精讀 ARC 干預實驗與 pass@2 設定,評估 latent recurrent ICL 可移植性。
Ex-Omni-2D:具原生視覺存在感的表現型全模態對話模型
全模態具身
為什麼重要:補上 omni 對話長期「有聲無身」缺口,一次協調文字、個性語音與參考條件影片。
帶走什麼:先預測 VTP(場景/情緒/動作),再以 multi-codebook speech units 對齊語音與影片;Teacher 蒸餾成少步 Streaming Student。
下一步:做數字人/語音對話產品時對齊 VTP 與 prefix streaming,避免強依賴齊全四元監督資料。