穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-07-17

HF 論文速讀 2026-07-17

開源多模態同步推進影像生成編輯品質,與 omni 影音的主動感知、token 效率與模態編排推理。

今天重點是開源用有限資料與算力逼近閉源影像生成編輯,並以主動感知、token 篩選與模態重排拉高 omni 影音理解。

今天先記三件事

  1. Boogu-Image-0.1 僅約 2.08 億張獨特影像、理論訓練成本約 40 萬美元,ImgEdit 4.64 等基準已逼近開源頂部…
  2. Omni 戰場集中在 OmniVideoBench、LVOmniBench、FutureOmni;主動感知、SEATS token 篩選與…
  3. MiniCPM-o 4.5 打即時全雙工互動;SEATS 訓練免費、約 35% token 保留仍具競爭準度與算力優勢。

五篇速讀

Boogu-Image-0.1:強化開源統一多模態理解與生成

開源影像全能

為什麼重要:在受限算力下,靠理解、資料與訓練管線加上 agentic 推論 scaling,生成與編輯基準逼近閉源。

帶走什麼:約 2.08 億張獨特影像、理論成本約 40 萬美元,即可在 ImgEdit、DPG、LongText 等拿到開源前段班。

下一步:先對照 Base/Edit/Turbo 變體與 ImgEdit、DPG、LongText 數字,評估能否接入開源工作流。

原生主動感知作為推理:邁向 Omni 模態理解

主動感知推理

為什麼重要:把 Observation-Thought-Action 主動感知當推理環境,OmniAgent-7B 在 OmniVideoBench 達 37.1。

帶走什麼:Omni 理解可不只被動吞完整影音,原生主動觀測與 agentic RL 能抬升表現。

下一步:關注 Qwen2.5-Omni-7B 基底與 Thinker-only OmniAgent-RL checkpoint 設定。

階段自適應 Token 選擇:高效 Omni-modal LLM

高效token篩選

為什麼重要:訓練免費 SEATS,約 35% token 保留下 LVOmniBench 38.5 第一、OmniVideoBench 40.1。

帶走什麼:視覺與音訊可差異化保留(約 32%/70%),在約 13.3 TFLOPs 等級仍保 omni 準度。

下一步:直接複現公開 SEATS 腳本,接到 Qwen3-Omni 推論管線做降本。

MiniCPM-o 4.5:邁向即時全雙工 Omni 模態互動

即時全雙工

為什麼重要:強調 real-time full-duplex omni 互動,FutureOmni 整體 Accuracy 56.1 居冠。

帶走什麼:開源 omni 從離線分數走向可同步影音、可預判的即時互動體驗。

下一步:查 openbmb 官方 checkpoint,試 full-duplex 與 FutureOmni 評測設定。

OmniJigsaw:以模態編排重排強化 Omni 模態推理

模態編排推理

為什麼重要:Modality-Orchestrated Reordering 與 CMM 變體,在完整影音協同下 OmniVideoBench 40.50 第一。

帶走什麼:影音協同推理可透過有序重排與 modality masking,明顯提升多選 QA 與 CoT 表現。

下一步:對照 CMM、greedy 加 chain-of-thought,評估能否遷移到其他 omni backbone。