穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-07-20

HF 論文速讀 2026-07-20

開源全模態模型正從單純看懂影音,轉向以主動感知、Token 節流與跨模態推理,兼顧效能、即時性與成本。

今天最重要的訊號是:開源多模態競爭不只比模型大小,而是比誰能更聰明地分配感知、推理與運算資源。

今天先記三件事

  1. Boogu-Image-0.1以208.62M獨特圖像,逼近閉源圖像生成與編輯能力。
  2. OmniVideoBench榜首競爭集中在音訊與影片協作推理,而非單一視覺理解。
  3. SEATS顯示推論時保留35% Token,仍能取得LVOmniBench第一。

五篇速讀

Boogu-Image-0.1:開源統一圖像理解與生成

開源圖像旗艦

為什麼重要:同時涵蓋生成、指令編輯、快速推論與中英文字渲染,並在多項圖像benchmark取得前段成績。

帶走什麼:高品質圖像系統的關鍵不只模型本身,還包括資料、訓練流程、理解能力與agentic推論擴展。

下一步:優先看其Base、Turbo、Edit分工,以及如何將理解能力接到圖像編輯工作流。

以原生主動感知推理全模態理解

主動感知路線

為什麼重要:OmniAgent把Observation、Thought、Action做成原生環境,讓模型主動取得影音線索再推理。

帶走什麼:全模態理解不能只被動吞入影音Token;模型是否知道下一步該觀察什麼同樣重要。

下一步:閱讀其Observation-Thought-Action設計,評估是否可移植到影音Agent任務。

SEATS:全模態LLM的階段自適應Token選擇

效率最佳化

為什麼重要:SEATS在35%整體Token保留率下,於LVOmniBench取得38.5% Accuracy與第一名。

帶走什麼:影音Token不必平均保留;視覺與音訊在不同推理階段需要不同的預算分配。

下一步:先研究其training-free實作,作為降低影音推論成本的候選方案。

MiniCPM-o 4.5:即時全雙工全模態互動

即時互動代表

為什麼重要:MiniCPM-o 4.5-Instruct在FutureOmni取得56.1% Accuracy,聚焦同步影音下的未來事件預測。

帶走什麼:全雙工互動的價值不只是能聽能看,而是能在持續輸入中預判接下來會發生什麼。

下一步:若關注語音助理或機器人,優先檢視其即時與全雙工互動設計。

OmniJigsaw:以模態編排重排序強化全模態推理

跨模態推理冠軍

為什麼重要:OmniJigsaw的CMM變體在OmniVideoBench取得40.50% top-1 Accuracy,排名第一。

帶走什麼:跨模態推理的效果取決於資訊呈現與推理順序;重排模態線索本身就是能力設計。

下一步:重點看Clip-level Modality Masking與模態重排序,理解其如何降低干擾。