HF 論文速讀 2026-07-23

影像編輯 SOTA 互搶榜,自駕則往可編譯場景生成與端到端軌跡蒸餾兩邊推進。
今天重點:高效 native-resolution 生成編輯棧、統一模型把 editing 當通才任務,自駕用 RAG 產 Scenic 場景與 JEPA 軌跡蒸餾刷 NAVSIM。
今天先記三件事
- GEdit-Bench:JoyAI-Image-Edit 以 G_O 8.290 居冠,Mage-Flow 4B 棧以 8.271 緊追並…
- Chat2Scenic 在 123 條法規對齊場景基準拿下 CSR 76.42%、FA 58.17%,把自然語言變成可編譯 Scenic。
- Drive-JEPA 單前視 512×256,V-JEPA 影片預訓練加軌跡蒸餾,NAVSIM v2 EPDMS 87.8、v1 PDMS…
五篇速讀
Mage-Flow:高效原生解析度影像生成與編輯基礎模型
高效生成編輯棧
為什麼重要:4B 級 Mage-VAE 加 native-resolution MM-DiT,GEdit-Bench G_O 8.271 排第二,訓練吞吐約 2.5 倍並有 4-step T…
帶走什麼:高保真 tokenizer 可再砍一個數量級成本;RL 對齊與 few-step 蒸餾可同時顧畫質、跟隨與延遲。
下一步:優先看 Mage-VAE、native packing 與 Base/RL/Turbo 家族分工,對照 GEdit 與延遲需求。
Chat2Scenic:迭代式 RAG 自駕場景生成框架
法規場景生成
為什麼重要:123 場景法規對齊基準 FA 58.17、CSR 76.42 第一;把 NL 編成可在 CARLA 跑的 Scenic 3.1 程式。
帶走什麼:Contextual prompting、CoT、CodeICL 取 top-3 Scenic snippet,比純文件 ICL 更能拉高編譯成功率與品質。
下一步:打開公開 repo 與基準,用自家規章庫換 retrieval,評估 CSR 與 Scenario Quality。
Drive-JEPA:影片 JEPA 遇見多模態軌跡蒸餾的端到端駕駛
端到端自駕SOTA
為什麼重要:完整 ViT/L 系統 NAVSIM v2 navtest EPDMS 87.8、v1 PDMS 93.7 皆列第一;單前相機加 32 條軌跡提案。
帶走什麼:駕駛影片 V-JEPA 預訓練加多模態軌跡蒸餾與 momentum-aware 選擇,可不靠重感測堆疊衝分。
下一步:抓 HF 上公開 ckpt,對 NAVSIM v2.2 協議重現,再測自家前視-only 設定。
在統一多模態理解與生成中喚醒空間智能
編輯榜首統一模
為什麼重要:JoyAI-Image-Edit 全量 GEdit-Bench-EN 以 G_O 8.290 拿下第一,強調空間智能與 prompt-enhancing 推論。
帶走什麼:統一理解—生成路線若把空間關係叫醒,再加 PE 推論,可直接推高編輯 overall 分數。
下一步:對照 Mage-Flow 的效率敘事,評估要極致分數還是可部署 4B 級棧。
Uni-Edit:智能編輯作為統一模型微調的通用任務
編輯當通才任務
為什麼重要:BAGEL-Uni-Edit stage-1 在 RISEBench 全套 thinking 模式 Overall Accuracy 17.2 排第二,約 14.7B 參數。
帶走什麼:把 intelligent editing 當通用 tuning 任務,可覆蓋 Temporal、Causal、Spatial、Logical 多維推理編輯。
下一步:若做統一多模態,用 RISEBench 嚴苛「全維滿分才算過」協議壓測,不只看 GEdit 美學分。