HF 速讀AI 論文
HF 論文速讀 2026-07-12

統一模型架構在機器人與多模態任務持續突破
今日論文聚焦統一 VLM、語言動作預訓練與多模態表示,讓預訓練先驗在機器人操控、圖分類、文件與音頻領域發揮最大泛化價值。
今天先記三件事
- InternVLA-A1.5 用潛在 foresight token 繼承視訊模型動態先驗,六大機器人基準全勝
- LAP 透過 Language-Action Pre-Training 實現零樣本跨機體遷移,在 LIBERO 任務領先
- 經典 GNN、DocOwl2 與 ONE-PEACE 分別在圖、文件與音頻領域展現強韌基線或多模態能力
五篇速讀
InternVLA-A1.5:讓 VLM 語意、未來想像與機器人動作合流
機器人統一 VLM 策略
為什麼重要:結合預訓練 VLM 語意與潛在未來預測,繼承視訊模型動態先驗,避免像素級生成干擾。
帶走什麼:未來預測改成潛在查詢問題,用少量 learnable foresight tokens 壓縮任務相關未來。
下一步:關注其 VQA 與 subtask prediction 持續訓練方式,應用於實體機器人即時控制。
LAP:用 Language-Action Pre-Training 做零樣本跨機體遷移
語言動作預訓練
為什麼重要:Language-Action Pre-Training 讓策略在不同機體間零樣本遷移,LIBERO 多任務表現突出。
帶走什麼:與 VQA 資料共同訓練,提升語言與動作的跨 embodiment 泛化能力。
下一步:測試其在不同機器人平台上的零樣本轉移表現,作為新 baseline。
Classic GNN 仍然能當強基線:簡單架構不一定輸給新模型
經典 GNN 強基線
為什麼重要:簡單圖神經網路架構在 ogbg-ppa 圖分類任務達到 SOTA,提醒新模型需與經典比較。
帶走什麼:Classic GNNs 仍具強大競爭力,適合作為圖級任務的可靠 baseline。
下一步:重新評估你的圖任務是否需要複雜新架構,先試經典 GNN。
mPLUG-DocOwl2:不用 OCR 也能壓縮高解析多頁文件理解
高解析文件理解
為什麼重要:OCR-free 多頁文件理解,用高解析壓縮視覺 token 在 TabFact 達到高準確率。
帶走什麼:每張圖 324 visual tokens 實現高效多頁文件問答與表格推理。
下一步:應用於文件問答或表格推理任務,測試其 OCR-free 優勢。
ONE-PEACE:朝向不限模態的一個通用表示模型
通用多模態表示
為什麼重要:單一通用表示模型朝向無限模態,在音頻分類等多任務取得領先成績。
帶走什麼:A-Branch 編碼搭配多頭注意力池化,BCELoss 處理多標籤音頻任務。
下一步:探索其在視覺、語言或其他模態的擴展潛力。