HF 論文速讀 2026-07-17

開源多模態同步推進影像生成編輯品質,與 omni 影音的主動感知、token 效率與模態編排推理。
今天重點是開源用有限資料與算力逼近閉源影像生成編輯,並以主動感知、token 篩選與模態重排拉高 omni 影音理解。
今天先記三件事
- Boogu-Image-0.1 僅約 2.08 億張獨特影像、理論訓練成本約 40 萬美元,ImgEdit 4.64 等基準已逼近開源頂部…
- Omni 戰場集中在 OmniVideoBench、LVOmniBench、FutureOmni;主動感知、SEATS token 篩選與…
- MiniCPM-o 4.5 打即時全雙工互動;SEATS 訓練免費、約 35% token 保留仍具競爭準度與算力優勢。
五篇速讀
Boogu-Image-0.1:強化開源統一多模態理解與生成
開源影像全能
為什麼重要:在受限算力下,靠理解、資料與訓練管線加上 agentic 推論 scaling,生成與編輯基準逼近閉源。
帶走什麼:約 2.08 億張獨特影像、理論成本約 40 萬美元,即可在 ImgEdit、DPG、LongText 等拿到開源前段班。
下一步:先對照 Base/Edit/Turbo 變體與 ImgEdit、DPG、LongText 數字,評估能否接入開源工作流。
原生主動感知作為推理:邁向 Omni 模態理解
主動感知推理
為什麼重要:把 Observation-Thought-Action 主動感知當推理環境,OmniAgent-7B 在 OmniVideoBench 達 37.1。
帶走什麼:Omni 理解可不只被動吞完整影音,原生主動觀測與 agentic RL 能抬升表現。
下一步:關注 Qwen2.5-Omni-7B 基底與 Thinker-only OmniAgent-RL checkpoint 設定。
階段自適應 Token 選擇:高效 Omni-modal LLM
高效token篩選
為什麼重要:訓練免費 SEATS,約 35% token 保留下 LVOmniBench 38.5 第一、OmniVideoBench 40.1。
帶走什麼:視覺與音訊可差異化保留(約 32%/70%),在約 13.3 TFLOPs 等級仍保 omni 準度。
下一步:直接複現公開 SEATS 腳本,接到 Qwen3-Omni 推論管線做降本。
MiniCPM-o 4.5:邁向即時全雙工 Omni 模態互動
即時全雙工
為什麼重要:強調 real-time full-duplex omni 互動,FutureOmni 整體 Accuracy 56.1 居冠。
帶走什麼:開源 omni 從離線分數走向可同步影音、可預判的即時互動體驗。
下一步:查 openbmb 官方 checkpoint,試 full-duplex 與 FutureOmni 評測設定。
OmniJigsaw:以模態編排重排強化 Omni 模態推理
模態編排推理
為什麼重要:Modality-Orchestrated Reordering 與 CMM 變體,在完整影音協同下 OmniVideoBench 40.50 第一。
帶走什麼:影音協同推理可透過有序重排與 modality masking,明顯提升多選 QA 與 CoT 表現。
下一步:對照 CMM、greedy 加 chain-of-thought,評估能否遷移到其他 omni backbone。