穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-06-20

HF 論文速讀 2026-06-20

今天共同趨勢是從單純堆大模型,轉向統一架構、任務專家與可自動優化的高效率系統。

AI 系統正在把多模態、對齊、修補、Prompt 與深度估計,推向更統一且更省算力的實用化。

今天先記三件事

  1. HiDream-O1-Image 直接在 pixel-space 統一生成與編輯。
  2. TMPO 用 trajectory distribution matching 減少 reward hacking。
  3. Moebius 與 FAPO 代表小模型、Pipeline 自優化的落地路線。

五篇速讀

HiDream-O1-Image:原生統一圖像生成模型

統一生成

為什麼重要:用 Unified Transformer 把像素、文字、條件放進同一 token space。

帶走什麼:它試圖拿掉外部 VAE 與分離 text encoder,讓生成與編輯變成同一套 in-context 流程。

下一步:關注其在文字生成、編輯、個人化任務上的實測與開源細節。

TMPO:多樣且高效的 Diffusion Alignment

對齊方法

為什麼重要:針對 diffusion RL alignment 的 reward hacking 與 mode collapse 問題。

帶走什麼:從最大化單一 reward,改成匹配 trajectory-level reward distribution。

下一步:若你在調圖像模型偏好,優先比較 TMPO 與既有 RL 對齊法的多樣性。

Moebius:0.2B 高效影像修補模型

輕量修補

為什麼重要:主打以 0.2B 輕量架構挑戰 10B-level inpainting 效果。

帶走什麼:LλMI block 加 latent-space 多粒度蒸餾,是它壓縮又保真關鍵。

下一步:適合先看是否能部署到低成本影像修補產品或內部工具。

FAPO:自動優化多步驟 LLM Pipeline

Prompt自優

為什麼重要:不只改 prompt,還能診斷 retrieval、reasoning、formatting 的鏈式瓶頸。

帶走什麼:FAPO 讓 Claude Code 在受限範圍內反覆評估、歸因、修改與驗證 pipeline。

下一步:可拿來對照現有 GEPA 或手調 prompt 流程,評估是否值得自動化。

MetricAnything:大規模 Metric Depth 預訓練

深度預訓練

為什麼重要:聚焦用 noisy heterogeneous sources 擴展 metric depth pretraining。

帶走什麼:在多個 metric depth benchmark 有 PWC SOTA 訊號,摘要提到 ScanNet 測試 AbsRel 5.90%。

下一步:若做 3D reconstruction 或 monocular depth,應查其資料混合與泛化設定。