穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-06-13

HF 論文速讀 2026-06-13

今天的共同趨勢是:AI 系統能力不只靠更大模型,也靠更好的環境、介面、記憶與稀疏計算設計。

下一波 AI 進展,重點是把模型放進更會探索、推理、模擬與長文處理的系統裡。

今天先記三件事

  1. MiniMax MSA 瞄準百萬 token 長 context 的部署成本
  2. SpatialClaw 用 stateful Python 讓 VLM 做開放式 3D/4D 推理
  3. EurekAgent 把科研 Agent 重點轉向 environment engineering

五篇速讀

EurekAgent:讓研究 Agent 在對的環境裡自動發現

科研Agent

為什麼重要:把 autonomous scientific discovery 的瓶頸從 workflow 轉向環境設計。

帶走什麼:權限、artifact、budget、人類介入,比單純規劃流程更能塑造 Agent 行為。

下一步:看它如何抑制 reward hacking 與降低人工監督摩擦。

WEAVER:更快、更長、更準的機器人 world model

機器人WM

為什麼重要:world model 若同時有 fidelity、consistency、efficiency,才適合機器人決策。

帶走什麼:WEAVER 用 multi-view、flow-matching 預測 latent 與 reward,支援長程操作。

下一步:優先看硬體實驗與 policy evaluation 的相關性結果。

SpatialClaw:把 code 變成 VLM 的空間推理手

空間Agent

為什麼重要:它指出 spatial reasoning 的關鍵不只在感知工具,而在 action interface。

帶走什麼:用 stateful Python kernel 逐步寫 code,比一次性 code 或固定 tool call 更彈性。

下一步:拿它對照你現有 VLM tool-use 架構的介面限制。

vFusedSeg3D:Waymo 3D 語意分割挑戰的強基線

3D分割

為什麼重要:在 Waymo Open Dataset 3D semantic segmentation 有明確排行榜訊號。

帶走什麼:PWC 訊號顯示其 validation mIoU 為 72.46,rank #2。

下一步:若做自駕 3D segmentation,可當 Waymo baseline 追蹤。

MiniMax Sparse Attention:百萬 context 的便宜注意力

長文注意力

為什麼重要:長 context 正成為 Agent、repo-scale code reasoning、persistent memory 的硬需求。

帶走什麼:MSA 用 GQA 上的 blockwise sparse attention,讓各 group 選自己的 Top-k KV blocks。

下一步:重點看 Index Branch、KV-outer sparse attention 與 GPU 路徑設計。