HF 論文速讀 2026-07-07

具身AI runtime、世界模型評測、研究自動化與agent安全測試同步推進
今天五篇論文聚焦機器人部署效率、世界模型作為policy評測工具、論文到多媒體自動化,以及LLM agent安全框架的實務落地。
今天先記三件事
- MoGe-2在多個深度估計benchmark取得SOTA,支援公尺尺度單眼幾何。
- Embodied.cpp提供跨異質機器人的C++ runtime,解決部署碎片問題。
- GigaWorld-1與Vera分別建立world model評測基準與agent安全測試流程。
五篇速讀
MoGe-2:單眼幾何估計同時具備公尺尺度與銳利細節
深度估計新SOTA
為什麼重要:在iBims-1、NYUv2、KITTI等benchmark取得頂尖AbsRel成績,支援零樣本公尺尺度輸出。
帶走什麼:單眼深度估計可同時達到公尺尺度與細節銳利,KITTI Rel^d=3.75%、delta1^d=98.1%。
下一步:測試其在機器人視覺導航或AR場景的實際表現。
Embodied.cpp:讓具身模型真正跑進不同機器人的C++ runtime
具身AI部署利器
為什麼重要:解決VLA與WAM模型在異質邊緣裝置上的多速率、延遲優先推論需求。
帶走什麼:五層架構支援模組化執行與可擴展I/O,讓單一後端跑遍多種機器人與模擬器。
下一步:下載runtime並在HY-VLA或pi0模型上進行latency-first推論測試。
GigaWorld-1:用world model替機器人policy做可擴展評測
world model…
為什麼重要:提出WMBench,涵蓋324000次模擬rollout與12000小時真實資料,分析7種video world model。
帶走什麼:world model可作為policy評測代理,但evaluator品質與action編碼選擇仍需系統驗證。
下一步:參考WMBench結果,選擇適合自己機器人任務的world model與action representation。
ResearchStudio-Reel:把論文最後一哩變成可編輯的poster、video、blog
研究傳播自動化
為什麼重要:一次抽取Paper2Assets,後續三個generator產出可回編輯的PowerPoint、影片與雙語blog。
帶走什麼:用agent-readable contract與deterministic render gate,確保事實一致且可重複編輯。
下一步:在Claude Code或Codex環境中安裝Paper2Reel技能,試跑自己的論文。
Vera:把LLM Agent安全測試做成可執行證據鏈
agent安全測試框架
為什麼重要:三階段管線:文獻探索風險分類、組合產生安全案例、沙箱自適應執行與證據驗證。
帶走什麼:不再依賴硬編碼規則,而是從可觀察artifacts產生可重複驗證的安全證據。
下一步:在隔離沙箱中用Vera對自家agent進行多turn安全案例測試。