HF 論文速讀 2026-07-30

開放式代理成主軸:視覺網頁代理、機器人 VLA 與程式碼倉庫上下文基礎設施同步推進。
今天重點是把代理做開、做穩:MolmoWeb 開源視覺網頁代理登頂,π 系列與 GR00T 搶機器人榜,CodeNib 專治 coding agent 的 repo 上下文成本。
今天先記三件事
- MolmoWeb 只靠截圖做瀏覽器動作,WebTailBench 49.5%、DeepShop 42.3% 居首,並公開 MolmoWeb…
- ArmnetBench v0.1 上 π₀.₅ 領先(51.5/47.6),π₀ 第二、GR00T N1 第三,皆為 50 demo/ta…
- CodeNib 多視圖 repo 上下文:更新可快 8.7×/25.4×,導航延遲比 4.7×,軌跡 token 省 50–87%。
五篇速讀
MolmoWeb:開放視覺網頁代理與開放網路資料
開源網頁代理
為什麼重要:主流強網頁代理多閉源;此作公開資料混合與 4B/8B 視覺動作策略,並在兩項 browser-use 榜奪冠。
帶走什麼:MolmoWebMix 含 10 萬+合成軌跡、3 萬+人類示範與 GUI 感知;只依指令與截圖預測下一步,不需 HTML/a11y/API。
下一步:若做 computer-use,先對齊其 screenshot-only 設定與 WebTailBench/DeepShop 指標再複現。
π₀.₅:具備開放世界泛化的視覺-語言-動作模型
機器人 VLA 榜首
為什麼重要:ArmnetBench v0.1 十二項真實 SO-101 任務匯總中 Success+Suboptimal 51.5、Success 47.6,目前第一。
帶走什麼:在每任務約 50 筆示範、數百次人工評分 rollout 的公平池化設定下,開世界泛化 VLA 仍明顯拉開差距。
下一步:跟機器人泛化就從 π₀.₅ 與 ArmnetBench 協議讀起,對照同表 π₀、GR00T。
π₀:通用機器人控制的視覺-語言-動作 flow 模型
VLA flow 基線
為什麼重要:同榜第二:Success+Suboptimal 40.4、Success 35.1,是理解 π 系列演進與 flow 動作建模的關鍵前作。
帶走什麼:通用 robot control 的 VLA flow 路線已成強基線;後續 π₀.₅ 在相同 50-demo 設定上再往上推一截。
下一步:先建立 π₀ 的 flow-VLA 直覺,再看 π₀.₅ 多了哪些開放世界泛化設計。
GR00T N1:通用人形機器人開放基礎模型
人形基礎模型
為什麼重要:ArmnetBench 第三(33.1/29.4),代表開放 generalist humanoid 路線在同一真實臂台評測上的位置。
帶走什麼:開放人形/通用操控基礎模型可作為對照系;在 SO-101、50 demo/task 下仍落後領先 VLA。
下一步:做人形或跨本体时,把 GR00T N1 當 open foundation 基線,並用同一 ArmnetBench 口徑比。
CodeNib:為程式碼代理提供倉庫上下文的多視圖資料系統
Repo 上下文基建
為什麼重要:HF 熱度高;直接打中 coding agent 反覆搜尋、導航、重找上下文與生命週期成本不透明的痛點。
帶走什麼:按 commit 建詞法/稠密/結構視圖並跨編輯維護;圖與向量更新中位快 8.7×、25.4×,token 可少 50–87%。
下一步:自建 coding agent 記憶層時,優先評估多視圖 serving 與 validity boundary,而非只堆 grep/RA…