HF 論文速讀 2026-06-17

AI 正從看懂資料,轉向可互動、懂幾何、能長時間維持狀態的世界代理。
今天重點是把視覺、幾何、時間與行動接成可互動的智能系統。
今天先記三件事
- 世界模型開始追求長程、一致、可控制互動
- 3D 幾何成為機器人與偵測模型的核心底座
- 即時 VL 互動從被動問答走向主動開口
五篇速讀
VGGT-Det:挖掘 VGGT 內部先驗的免感測器幾何多視角室內 3D 物件偵測
3D偵測
為什麼重要:不用 sensor poses 或 depth,也能做多視角室內 3D detection。
帶走什麼:VGGT 的內部幾何先驗可被轉用成 SG-Free 3D 偵測能力。
下一步:看 Table 1 與 AG+QD 設計,評估能否接到自家多視角資料。
DreamX-World 1.0:通用互動式世界模型
世界模型
為什麼重要:把 text/image-to-video 推向可控制、可回訪、長程互動生成。
帶走什麼:E-PRoPE、causal forcing 與 memory retrieval 是關鍵模組。
下一步:優先看 camera control、long-rollout training 與 scene persistence。
Geometric Action Model:用於機器人策略學習的幾何行動模型
機器人策略
為什麼重要:把 pretrained GFM 直接改造成感知、預測與 action decoding 共用底座。
帶走什麼:機器人 policy 不只看 2D frame,而是顯式借力 3D 幾何。
下一步:觀察 split-layer GFM 與 future token prediction 如何接 action。
JoyAI-VL-Interaction:即時視覺語言互動智慧
即時互動
為什麼重要:主張模型應持續觀看、自己決定沉默、回應或交給背景模型。
帶走什麼:VL 互動從 turn-based QA 走向 vision-triggered real-time agent。
下一步:先看其 response decision 設計與開源 training recipe。
S4L:Self-Supervised Semi-Supervised Learning
半監督基線
為什麼重要:在 ImageNet 10% labels 設定仍是重要 semi-supervised SOTA 訊號。
帶走什麼:Rotation、VAT、EntMin、pseudo-labeling、fine-tune 可互補。
下一步:作為少標籤分類 baseline,對照現代 SSL/半監督方法。