HF 論文速讀 2026-08-01

醫學多模態、自我進化 MLE、具身資料與手機代理齊推 SOTA,探索成預訓練第三軸。
今天重點:Frontis-MA1 用 AI4AI 把 MLE 獎牌率拉到七成級、ClinFusion 攻醫學視覺、ACE 補具身閉環資料、探索式建模與開源手機代理齊發。
今天先記三件事
- Frontis-MA1(35B)在 MLE-Bench Lite 上將 Medal Average 從 39.39% 拉到 60.61%,…
- ClinFusion 以 cascade 視覺編碼統一 2D/3D,MedQA Accuracy 86.6 居首並推臨床對齊評測。
- ACE-Data-0 用居家 ambient capture 收 150 小時、17M 幀、7.5 萬交互,補全感知—動作閉環。
五篇速讀
ClinFusion:以視覺為核心的多模態 LLM,追求整體醫學理解
醫學視覺 MLLM
為什麼重要:臨床落地是視覺中心題:須吃雜訊 2D/3D,且評測要對齊放射科事實性與細粒度。
帶走什麼:Cascade Spatial-Aware Locality Fusion 統一 2D/原生 3D;MedIF-Bench 與 ROI 接地評測;MedQA 86.6 等 SOT…
下一步:做醫學 VQA/報告生成時對照其融合編碼與 region-grounded 評測協議。
Frontis-MA1:訓練朝向機器學習工程遞迴自我改進的 AI4AI 模型
AI4AI 元進化
為什麼重要:RSI 需要會改進「造 AI 流程」的系統;MLE 有可執行回饋,是具體試驗床。
帶走什麼:OpenMLE(Gym/RL/Evo)用 Draft/Improve/Debug/Crossover;4090 12GB 12 小時內獎牌均 60.61%–71.21%。
下一步:若做 auto-MLE/agent,優先讀 OpenMLE 與四算子對齊的 SFT+RL 閉環。
Explorative Modeling:解鎖預訓練第三軸與端到端生成
生成預訓練新軸
為什麼重要:生成多為分解採樣、難真正 end-to-end;多峰分佈易被平均模糊。
帶走什麼:訓練環探索 K 組 generation–data 匹配並訓最佳;探索成參數/資料外第三軸,增益隨規模上升。
下一步:訓練圖像/影片/語言模型時,把 exploration budget 當可 sweep 的縮放維度。
ACE-Data-0:以人為中心的環境捕捉作為具身資料引擎
具身資料引擎
為什麼重要:具身智能缺第一人稱—全身—靈巧—物體—聲觸同步的完整感知—動作閉環資料。
帶走什麼:ACE 桌面/房間雙尺度校准同步;ACE-Data-0:150 小時、17M 幀、200 類、50 人、7.5 萬 episode。
下一步:訓 world model/機器人策略時,用其多視角與觸覺—音訊對齊設計採集管線。
訓練開源模型以實現代理式手機使用
手機 GUI 代理
為什麼重要:真實 App 操作是 computer-use 硬仗;開源若能衝 AndroidWorld 頂標就有部署意義。
帶走什麼:混合 real-app + mock-app 的 RL checkpoint,在 AndroidWorld Success Rate 達 83.2% 排名第一。
下一步:做 Android 代理時對齊該混合 RL 設定與 83.2% 基線再比自家成功率。