HF 論文速讀 2026-07-20

開源全模態模型正從單純看懂影音,轉向以主動感知、Token 節流與跨模態推理,兼顧效能、即時性與成本。
今天最重要的訊號是:開源多模態競爭不只比模型大小,而是比誰能更聰明地分配感知、推理與運算資源。
今天先記三件事
- Boogu-Image-0.1以208.62M獨特圖像,逼近閉源圖像生成與編輯能力。
- OmniVideoBench榜首競爭集中在音訊與影片協作推理,而非單一視覺理解。
- SEATS顯示推論時保留35% Token,仍能取得LVOmniBench第一。
五篇速讀
Boogu-Image-0.1:開源統一圖像理解與生成
開源圖像旗艦
為什麼重要:同時涵蓋生成、指令編輯、快速推論與中英文字渲染,並在多項圖像benchmark取得前段成績。
帶走什麼:高品質圖像系統的關鍵不只模型本身,還包括資料、訓練流程、理解能力與agentic推論擴展。
下一步:優先看其Base、Turbo、Edit分工,以及如何將理解能力接到圖像編輯工作流。
以原生主動感知推理全模態理解
主動感知路線
為什麼重要:OmniAgent把Observation、Thought、Action做成原生環境,讓模型主動取得影音線索再推理。
帶走什麼:全模態理解不能只被動吞入影音Token;模型是否知道下一步該觀察什麼同樣重要。
下一步:閱讀其Observation-Thought-Action設計,評估是否可移植到影音Agent任務。
SEATS:全模態LLM的階段自適應Token選擇
效率最佳化
為什麼重要:SEATS在35%整體Token保留率下,於LVOmniBench取得38.5% Accuracy與第一名。
帶走什麼:影音Token不必平均保留;視覺與音訊在不同推理階段需要不同的預算分配。
下一步:先研究其training-free實作,作為降低影音推論成本的候選方案。
MiniCPM-o 4.5:即時全雙工全模態互動
即時互動代表
為什麼重要:MiniCPM-o 4.5-Instruct在FutureOmni取得56.1% Accuracy,聚焦同步影音下的未來事件預測。
帶走什麼:全雙工互動的價值不只是能聽能看,而是能在持續輸入中預判接下來會發生什麼。
下一步:若關注語音助理或機器人,優先檢視其即時與全雙工互動設計。
OmniJigsaw:以模態編排重排序強化全模態推理
跨模態推理冠軍
為什麼重要:OmniJigsaw的CMM變體在OmniVideoBench取得40.50% top-1 Accuracy,排名第一。
帶走什麼:跨模態推理的效果取決於資訊呈現與推理順序;重排模態線索本身就是能力設計。
下一步:重點看Clip-level Modality Masking與模態重排序,理解其如何降低干擾。