HF 論文速讀 2026-07-11

代理基準、機器人統一模型、即時影片生成與科學想法譜系成為今日共同焦點。
AI 正從沙箱評測走向真實世界動態應用,涵蓋代理、機器人、影片與科學推理多領域突破。
今天先記三件事
- UniClawBench 提供五能力驅動的 400 真實任務代理基準
- InternVLA-A1.5 在六項機器人模擬基準全拿最佳成績
- Vidu S1 支援語音控制即時 540p 影片最高 42 FPS
五篇速讀
UniClawBench:主動代理在真實世界任務的通用基準
代理評測基準
為什麼重要:現有基準多依賴沙箱與單輪評估,混雜多種能力難找失敗根因,此基準改用五項基礎能力驅動。
帶走什麼:包含 400 雙語真實任務,以 Docker 容器即時執行並用細粒度步驟檢查點評分。
下一步:關注 Skill Usage、Exploration、Long-Context Reasoning 等五項核心能力。
InternVLA-A1.5:統一理解、潛在預測與動作以達組合泛化
機器人統一模型
為什麼重要:預訓練 1.2M 機器人片段與 3M 多模態樣本,在六個模擬基準全拿最佳成績,多項 SOTA。
帶走什麼:用少量可學習 foresight tokens 繼承預訓練影片生成器世界模型先驗,不需像素級生成。
下一步:查看 RoboTwin 成功率 93.0 與 SimplerEnv WidowX 成功率 80.8 等 SOTA 結果。
經典 GNN 能否成為圖層級任務強基準?簡單架構展現卓越
圖神經網路
為什麼重要:在 ogbg-ppa 圖分類任務達到 0.8258 準確率,刷新 Papers with Code 排行榜。
帶走什麼:簡單經典 GNN 架構在圖層級任務仍可展現強大競爭力,值得重新評估。
下一步:重新測試經典 GNN 在其他圖分類基準的表現。
Vidu S1:即時互動影片生成模型
即時影片生成
為什麼重要:支援語音即時控制數位角色,540p 影片最高 42 FPS,消費者 GPU 即可執行,無模糊或漂移。
帶走什麼:可上傳自訂真人、動漫、寵物圖像,選擇不同語音語調,線上 demo 直接可玩。
下一步:前往 https://vidu.com/vidu-stream 體驗即時語音互動影片生成。
想法有基因組:科學譜系推理與想法生成基準
科學想法基準
為什麼重要:提供 1961 黃金譜系追蹤、1085 Idea Genome 物件與 920 GenomeDiff,涵蓋 10 科學領域。
帶走什麼:用 IdeaGene 框架記錄繼承、突變、遺失、外部導入與新插入等六種演化動態。
下一步:探索 IG-Exam 42 種任務類型與 IG-Arena 的 Population-Evolution Score 評估。