穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-07-07

HF 論文速讀 2026-07-07

具身AI runtime、世界模型評測、研究自動化與agent安全測試同步推進

今天五篇論文聚焦機器人部署效率、世界模型作為policy評測工具、論文到多媒體自動化,以及LLM agent安全框架的實務落地。

今天先記三件事

  1. MoGe-2在多個深度估計benchmark取得SOTA,支援公尺尺度單眼幾何。
  2. Embodied.cpp提供跨異質機器人的C++ runtime,解決部署碎片問題。
  3. GigaWorld-1與Vera分別建立world model評測基準與agent安全測試流程。

五篇速讀

MoGe-2:單眼幾何估計同時具備公尺尺度與銳利細節

深度估計新SOTA

為什麼重要:在iBims-1、NYUv2、KITTI等benchmark取得頂尖AbsRel成績,支援零樣本公尺尺度輸出。

帶走什麼:單眼深度估計可同時達到公尺尺度與細節銳利,KITTI Rel^d=3.75%、delta1^d=98.1%。

下一步:測試其在機器人視覺導航或AR場景的實際表現。

Embodied.cpp:讓具身模型真正跑進不同機器人的C++ runtime

具身AI部署利器

為什麼重要:解決VLA與WAM模型在異質邊緣裝置上的多速率、延遲優先推論需求。

帶走什麼:五層架構支援模組化執行與可擴展I/O,讓單一後端跑遍多種機器人與模擬器。

下一步:下載runtime並在HY-VLA或pi0模型上進行latency-first推論測試。

GigaWorld-1:用world model替機器人policy做可擴展評測

world model…

為什麼重要:提出WMBench,涵蓋324000次模擬rollout與12000小時真實資料,分析7種video world model。

帶走什麼:world model可作為policy評測代理,但evaluator品質與action編碼選擇仍需系統驗證。

下一步:參考WMBench結果,選擇適合自己機器人任務的world model與action representation。

ResearchStudio-Reel:把論文最後一哩變成可編輯的poster、video、blog

研究傳播自動化

為什麼重要:一次抽取Paper2Assets,後續三個generator產出可回編輯的PowerPoint、影片與雙語blog。

帶走什麼:用agent-readable contract與deterministic render gate,確保事實一致且可重複編輯。

下一步:在Claude Code或Codex環境中安裝Paper2Reel技能,試跑自己的論文。

Vera:把LLM Agent安全測試做成可執行證據鏈

agent安全測試框架

為什麼重要:三階段管線:文獻探索風險分類、組合產生安全案例、沙箱自適應執行與證據驗證。

帶走什麼:不再依賴硬編碼規則,而是從可觀察artifacts產生可重複驗證的安全證據。

下一步:在隔離沙箱中用Vera對自家agent進行多turn安全案例測試。