穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-08-01

HF 論文速讀 2026-08-01

醫學多模態、自我進化 MLE、具身資料與手機代理齊推 SOTA,探索成預訓練第三軸。

今天重點:Frontis-MA1 用 AI4AI 把 MLE 獎牌率拉到七成級、ClinFusion 攻醫學視覺、ACE 補具身閉環資料、探索式建模與開源手機代理齊發。

今天先記三件事

  1. Frontis-MA1(35B)在 MLE-Bench Lite 上將 Medal Average 從 39.39% 拉到 60.61%,…
  2. ClinFusion 以 cascade 視覺編碼統一 2D/3D,MedQA Accuracy 86.6 居首並推臨床對齊評測。
  3. ACE-Data-0 用居家 ambient capture 收 150 小時、17M 幀、7.5 萬交互,補全感知—動作閉環。

五篇速讀

ClinFusion:以視覺為核心的多模態 LLM,追求整體醫學理解

醫學視覺 MLLM

為什麼重要:臨床落地是視覺中心題:須吃雜訊 2D/3D,且評測要對齊放射科事實性與細粒度。

帶走什麼:Cascade Spatial-Aware Locality Fusion 統一 2D/原生 3D;MedIF-Bench 與 ROI 接地評測;MedQA 86.6 等 SOT…

下一步:做醫學 VQA/報告生成時對照其融合編碼與 region-grounded 評測協議。

Frontis-MA1:訓練朝向機器學習工程遞迴自我改進的 AI4AI 模型

AI4AI 元進化

為什麼重要:RSI 需要會改進「造 AI 流程」的系統;MLE 有可執行回饋,是具體試驗床。

帶走什麼:OpenMLE(Gym/RL/Evo)用 Draft/Improve/Debug/Crossover;4090 12GB 12 小時內獎牌均 60.61%–71.21%。

下一步:若做 auto-MLE/agent,優先讀 OpenMLE 與四算子對齊的 SFT+RL 閉環。

Explorative Modeling:解鎖預訓練第三軸與端到端生成

生成預訓練新軸

為什麼重要:生成多為分解採樣、難真正 end-to-end;多峰分佈易被平均模糊。

帶走什麼:訓練環探索 K 組 generation–data 匹配並訓最佳;探索成參數/資料外第三軸,增益隨規模上升。

下一步:訓練圖像/影片/語言模型時,把 exploration budget 當可 sweep 的縮放維度。

ACE-Data-0:以人為中心的環境捕捉作為具身資料引擎

具身資料引擎

為什麼重要:具身智能缺第一人稱—全身—靈巧—物體—聲觸同步的完整感知—動作閉環資料。

帶走什麼:ACE 桌面/房間雙尺度校准同步;ACE-Data-0:150 小時、17M 幀、200 類、50 人、7.5 萬 episode。

下一步:訓 world model/機器人策略時,用其多視角與觸覺—音訊對齊設計採集管線。

訓練開源模型以實現代理式手機使用

手機 GUI 代理

為什麼重要:真實 App 操作是 computer-use 硬仗;開源若能衝 AndroidWorld 頂標就有部署意義。

帶走什麼:混合 real-app + mock-app 的 RL checkpoint,在 AndroidWorld Success Rate 達 83.2% 排名第一。

下一步:做 Android 代理時對齊該混合 RL 設定與 83.2% 基線再比自家成功率。