HF 論文速讀 2026-06-20

今天共同趨勢是從單純堆大模型,轉向統一架構、任務專家與可自動優化的高效率系統。
AI 系統正在把多模態、對齊、修補、Prompt 與深度估計,推向更統一且更省算力的實用化。
今天先記三件事
- HiDream-O1-Image 直接在 pixel-space 統一生成與編輯。
- TMPO 用 trajectory distribution matching 減少 reward hacking。
- Moebius 與 FAPO 代表小模型、Pipeline 自優化的落地路線。
五篇速讀
HiDream-O1-Image:原生統一圖像生成模型
統一生成
為什麼重要:用 Unified Transformer 把像素、文字、條件放進同一 token space。
帶走什麼:它試圖拿掉外部 VAE 與分離 text encoder,讓生成與編輯變成同一套 in-context 流程。
下一步:關注其在文字生成、編輯、個人化任務上的實測與開源細節。
TMPO:多樣且高效的 Diffusion Alignment
對齊方法
為什麼重要:針對 diffusion RL alignment 的 reward hacking 與 mode collapse 問題。
帶走什麼:從最大化單一 reward,改成匹配 trajectory-level reward distribution。
下一步:若你在調圖像模型偏好,優先比較 TMPO 與既有 RL 對齊法的多樣性。
Moebius:0.2B 高效影像修補模型
輕量修補
為什麼重要:主打以 0.2B 輕量架構挑戰 10B-level inpainting 效果。
帶走什麼:LλMI block 加 latent-space 多粒度蒸餾,是它壓縮又保真關鍵。
下一步:適合先看是否能部署到低成本影像修補產品或內部工具。
FAPO:自動優化多步驟 LLM Pipeline
Prompt自優
為什麼重要:不只改 prompt,還能診斷 retrieval、reasoning、formatting 的鏈式瓶頸。
帶走什麼:FAPO 讓 Claude Code 在受限範圍內反覆評估、歸因、修改與驗證 pipeline。
下一步:可拿來對照現有 GEPA 或手調 prompt 流程,評估是否值得自動化。
MetricAnything:大規模 Metric Depth 預訓練
深度預訓練
為什麼重要:聚焦用 noisy heterogeneous sources 擴展 metric depth pretraining。
帶走什麼:在多個 metric depth benchmark 有 PWC SOTA 訊號,摘要提到 ScanNet 測試 AbsRel 5.90%。
下一步:若做 3D reconstruction 或 monocular depth,應查其資料混合與泛化設定。