HF 論文速讀 2026-06-29

Computer Use Agents 透過 scaling 與多輪 RL 持續突破 benchmark
今天五篇論文顯示 GUI Agent 在 OSWorld、AndroidWorld 等平台成功率大幅提升,scaling agents 與自演化訓練成為關鍵。
今天先記三件事
- Scaling Agents OSWorld 100 steps 最高成功率 69.9%
- Step-GUI 8B 模型 AndroidWorld 成功率達 80.2%
- UI-TARS-2 多輪 RL 讓 GUI Agent 執行複雜任務
五篇速讀
Scaling Agents:電腦操作 Agent 開始吃到推論擴展
Scaling 效果證明
為什麼重要:OSWorld 100 steps 多模型達 60.2% 至 69.9% 成功率,證明 scaling agents 帶來 unreasonable effectiveness。
帶走什麼:更大 scale 的 agent 在電腦使用任務表現顯著更好。
下一步:持續追蹤 OSWorld 後續 100 steps benchmark。
Step-GUI:8B GUI Agent 用自演化訓練追上大型系統
小型模型突破
為什麼重要:8B 模型在 AndroidWorld 達 80.2%,MMB-GUI 達 85.6%,自演化訓練讓小模型追上大系統。
帶走什麼:自演化訓練是小型 GUI Agent 高效關鍵。
下一步:研究 Step-GUI 自演化訓練流程。
UI-TARS-2:多輪 RL 讓 GUI Agent 從點擊變成任務執行者
多輪 RL 應用
為什麼重要:Online-Mind2Web 成功率 88.2%,WindowsAgentArena 50.6%,230B MoE 模型展現多輪 RL 效果。
帶走什麼:多輪強化學習讓 GUI Agent 從簡單點擊進階到複雜任務。
下一步:閱讀 UI-TARS-2 技術報告 Table 1。
OpenCUA:開放 Computer-Use Agent 的資料與訓練底座
開放基礎建設
為什麼重要:提供開放資料與訓練底座,UI-V accuracy 達 37.3%,加速社群發展。
帶走什麼:開放資源是 Computer-Use Agent 生態重要基石。
下一步:下載 OpenCUA 開放資料集開始實驗。
Agent S2:Generalist-Specialist 架構讓桌面任務更可控
架構創新
為什麼重要:OSWorld 15 steps 成功率 27.0%,Generalist-Specialist 架構提升桌面任務可控性。
帶走什麼:組合式 generalist-specialist 架構讓 Agent 更穩定可控。
下一步:探索 Agent S2 的 compositional framework。