穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-06-29

HF 論文速讀 2026-06-29

Computer Use Agents 透過 scaling 與多輪 RL 持續突破 benchmark

今天五篇論文顯示 GUI Agent 在 OSWorld、AndroidWorld 等平台成功率大幅提升,scaling agents 與自演化訓練成為關鍵。

今天先記三件事

  1. Scaling Agents OSWorld 100 steps 最高成功率 69.9%
  2. Step-GUI 8B 模型 AndroidWorld 成功率達 80.2%
  3. UI-TARS-2 多輪 RL 讓 GUI Agent 執行複雜任務

五篇速讀

Scaling Agents:電腦操作 Agent 開始吃到推論擴展

Scaling 效果證明

為什麼重要:OSWorld 100 steps 多模型達 60.2% 至 69.9% 成功率,證明 scaling agents 帶來 unreasonable effectiveness。

帶走什麼:更大 scale 的 agent 在電腦使用任務表現顯著更好。

下一步:持續追蹤 OSWorld 後續 100 steps benchmark。

Step-GUI:8B GUI Agent 用自演化訓練追上大型系統

小型模型突破

為什麼重要:8B 模型在 AndroidWorld 達 80.2%,MMB-GUI 達 85.6%,自演化訓練讓小模型追上大系統。

帶走什麼:自演化訓練是小型 GUI Agent 高效關鍵。

下一步:研究 Step-GUI 自演化訓練流程。

UI-TARS-2:多輪 RL 讓 GUI Agent 從點擊變成任務執行者

多輪 RL 應用

為什麼重要:Online-Mind2Web 成功率 88.2%,WindowsAgentArena 50.6%,230B MoE 模型展現多輪 RL 效果。

帶走什麼:多輪強化學習讓 GUI Agent 從簡單點擊進階到複雜任務。

下一步:閱讀 UI-TARS-2 技術報告 Table 1。

OpenCUA:開放 Computer-Use Agent 的資料與訓練底座

開放基礎建設

為什麼重要:提供開放資料與訓練底座,UI-V accuracy 達 37.3%,加速社群發展。

帶走什麼:開放資源是 Computer-Use Agent 生態重要基石。

下一步:下載 OpenCUA 開放資料集開始實驗。

Agent S2:Generalist-Specialist 架構讓桌面任務更可控

架構創新

為什麼重要:OSWorld 15 steps 成功率 27.0%,Generalist-Specialist 架構提升桌面任務可控性。

帶走什麼:組合式 generalist-specialist 架構讓 Agent 更穩定可控。

下一步:探索 Agent S2 的 compositional framework。