HF 論文速讀 2026-08-02

生成模型、Agent 與具身系統正從單點能力競逐,走向以探索、執行回饋與多模態真實資料驅動的閉環進化。
今天的核心是:讓 AI 看得更完整、做得可驗證、並透過探索與真實互動資料持續變強。
今天先記三件事
- Frontis-MA1 把 MLE 的訓練、執行驗證與長程演化整合成 RSI 實驗場。
- Explorative Modeling 將探索量變成參數、資料之外的第三個預訓練擴展軸。
- 醫療、手機操作與具身機器人,都在以更貼近真實任務的評測與資料取代代理指標。
五篇速讀
ClinFusion:以視覺為核心的整體醫療多模態 LLM
醫療視覺整合
為什麼重要:同時處理 2D 與原生 3D 醫療影像,並將評測拉回放射科臨床所需的區域依據與事實正確性。
帶走什麼:醫療 MLLM 的瓶頸不只在問答知識,更在影像表示、臨床工作流對齊與可驗證的報告品質。
下一步:優先看 Cascade Spatial-Aware Locality Fusion 與 MedIF-Bench 的評測設計。
Frontis-MA1:邁向機器學習工程遞迴自我改進的 AI4AI 模型
AI 寫 AI
為什麼重要:以可執行的 MLE 任務測試 RSI,讓模型透過 Draft、Improve、Debug、Crossover 與執行回饋進行長程演化。
帶走什麼:Agent 能力提升不必只靠更大模型;把可驗證回饋、操作子學習與搜尋迴路接起來同樣關鍵。
下一步:先讀 OpenMLE 三層架構,再檢視其 MLE-Bench Lite 預算與比較條件。
Explorative Modeling:解鎖第三個預訓練軸與端到端生成
生成新範式
為什麼重要:不再分解生成流程,而是在訓練時探索多個候選匹配、挑選最佳者,使預測更能承諾於特定 mode。
帶走什麼:除了模型參數與資料量,探索次數可能是生成模型可系統化擴展的第三個關鍵資源。
下一步:聚焦 K 候選匹配的訓練目標,並比較影像、影片與語言實驗是否一致。
ACE-Data-0:以人為中心的環境捕捉具身資料引擎
具身資料基建
為什麼重要:將住宅變成校準且同步的多感測錄製環境,完整收集第一人稱感知、動作、物體、聲音與觸覺。
帶走什麼:具身智能的資料缺口在於感知與行動被切碎;高價值資料必須保留跨視角、跨模態、跨時間的連續性。
下一步:查看桌面與房間兩種尺度如何互補,以及資料格式是否能直接支援 world model。
訓練開源模型進行 Agentic Phone Use
手機操作 Agent
為什麼重要:摘要訊號顯示其在 AndroidWorld 的 Computer Use Agents 任務取得第一名成功率,聚焦真實 App 與模擬 App 的 RL 訓練。
帶走什麼:手機 Agent 的核心不只是看懂介面,而是要在多步驟互動中穩定完成可量測的任務。
下一步:先追 Table 2 與 real-app、mock-app 混合 RL checkpoint 的訓練差異。