穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-07-23

HF 論文速讀 2026-07-23

影像編輯 SOTA 互搶榜,自駕則往可編譯場景生成與端到端軌跡蒸餾兩邊推進。

今天重點:高效 native-resolution 生成編輯棧、統一模型把 editing 當通才任務,自駕用 RAG 產 Scenic 場景與 JEPA 軌跡蒸餾刷 NAVSIM。

今天先記三件事

  1. GEdit-Bench:JoyAI-Image-Edit 以 G_O 8.290 居冠,Mage-Flow 4B 棧以 8.271 緊追並…
  2. Chat2Scenic 在 123 條法規對齊場景基準拿下 CSR 76.42%、FA 58.17%,把自然語言變成可編譯 Scenic。
  3. Drive-JEPA 單前視 512×256,V-JEPA 影片預訓練加軌跡蒸餾,NAVSIM v2 EPDMS 87.8、v1 PDMS…

五篇速讀

Mage-Flow:高效原生解析度影像生成與編輯基礎模型

高效生成編輯棧

為什麼重要:4B 級 Mage-VAE 加 native-resolution MM-DiT,GEdit-Bench G_O 8.271 排第二,訓練吞吐約 2.5 倍並有 4-step T…

帶走什麼:高保真 tokenizer 可再砍一個數量級成本;RL 對齊與 few-step 蒸餾可同時顧畫質、跟隨與延遲。

下一步:優先看 Mage-VAE、native packing 與 Base/RL/Turbo 家族分工,對照 GEdit 與延遲需求。

Chat2Scenic:迭代式 RAG 自駕場景生成框架

法規場景生成

為什麼重要:123 場景法規對齊基準 FA 58.17、CSR 76.42 第一;把 NL 編成可在 CARLA 跑的 Scenic 3.1 程式。

帶走什麼:Contextual prompting、CoT、CodeICL 取 top-3 Scenic snippet,比純文件 ICL 更能拉高編譯成功率與品質。

下一步:打開公開 repo 與基準,用自家規章庫換 retrieval,評估 CSR 與 Scenario Quality。

Drive-JEPA:影片 JEPA 遇見多模態軌跡蒸餾的端到端駕駛

端到端自駕SOTA

為什麼重要:完整 ViT/L 系統 NAVSIM v2 navtest EPDMS 87.8、v1 PDMS 93.7 皆列第一;單前相機加 32 條軌跡提案。

帶走什麼:駕駛影片 V-JEPA 預訓練加多模態軌跡蒸餾與 momentum-aware 選擇,可不靠重感測堆疊衝分。

下一步:抓 HF 上公開 ckpt,對 NAVSIM v2.2 協議重現,再測自家前視-only 設定。

在統一多模態理解與生成中喚醒空間智能

編輯榜首統一模

為什麼重要:JoyAI-Image-Edit 全量 GEdit-Bench-EN 以 G_O 8.290 拿下第一,強調空間智能與 prompt-enhancing 推論。

帶走什麼:統一理解—生成路線若把空間關係叫醒,再加 PE 推論,可直接推高編輯 overall 分數。

下一步:對照 Mage-Flow 的效率敘事,評估要極致分數還是可部署 4B 級棧。

Uni-Edit:智能編輯作為統一模型微調的通用任務

編輯當通才任務

為什麼重要:BAGEL-Uni-Edit stage-1 在 RISEBench 全套 thinking 模式 Overall Accuracy 17.2 排第二,約 14.7B 參數。

帶走什麼:把 intelligent editing 當通用 tuning 任務,可覆蓋 Temporal、Causal、Spatial、Logical 多維推理編輯。

下一步:若做統一多模態,用 RISEBench 嚴苛「全維滿分才算過」協議壓測,不只看 GEdit 美學分。