穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-06-17

HF 論文速讀 2026-06-17

AI 正從看懂資料,轉向可互動、懂幾何、能長時間維持狀態的世界代理。

今天重點是把視覺、幾何、時間與行動接成可互動的智能系統。

今天先記三件事

  1. 世界模型開始追求長程、一致、可控制互動
  2. 3D 幾何成為機器人與偵測模型的核心底座
  3. 即時 VL 互動從被動問答走向主動開口

五篇速讀

VGGT-Det:挖掘 VGGT 內部先驗的免感測器幾何多視角室內 3D 物件偵測

3D偵測

為什麼重要:不用 sensor poses 或 depth,也能做多視角室內 3D detection。

帶走什麼:VGGT 的內部幾何先驗可被轉用成 SG-Free 3D 偵測能力。

下一步:看 Table 1 與 AG+QD 設計,評估能否接到自家多視角資料。

DreamX-World 1.0:通用互動式世界模型

世界模型

為什麼重要:把 text/image-to-video 推向可控制、可回訪、長程互動生成。

帶走什麼:E-PRoPE、causal forcing 與 memory retrieval 是關鍵模組。

下一步:優先看 camera control、long-rollout training 與 scene persistence。

Geometric Action Model:用於機器人策略學習的幾何行動模型

機器人策略

為什麼重要:把 pretrained GFM 直接改造成感知、預測與 action decoding 共用底座。

帶走什麼:機器人 policy 不只看 2D frame,而是顯式借力 3D 幾何。

下一步:觀察 split-layer GFM 與 future token prediction 如何接 action。

JoyAI-VL-Interaction:即時視覺語言互動智慧

即時互動

為什麼重要:主張模型應持續觀看、自己決定沉默、回應或交給背景模型。

帶走什麼:VL 互動從 turn-based QA 走向 vision-triggered real-time agent。

下一步:先看其 response decision 設計與開源 training recipe。

S4L:Self-Supervised Semi-Supervised Learning

半監督基線

為什麼重要:在 ImageNet 10% labels 設定仍是重要 semi-supervised SOTA 訊號。

帶走什麼:Rotation、VAT、EntMin、pseudo-labeling、fine-tune 可互補。

下一步:作為少標籤分類 baseline,對照現代 SSL/半監督方法。