穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-06-16

HF 論文速讀 2026-06-16

今天共同趨勢是從更開放的訓練食譜、檢索設計到因果世界模型,讓 AI 系統更可驗證也更可部署。

AI 進展正在從單純堆模型,轉向公開食譜、有效檢索與可控世界理解。

今天先記三件事

  1. i1 展示 fully open T2I 也能逼近強模型
  2. 長影片 RAG 的關鍵變成取回什麼與怎麼用
  3. Robotics 開始用 causal world modeling 強化控制

五篇速讀

i1:完全開放的 Text-to-Image 訓練食譜

開放食譜

為什麼重要:公開 weights、data、code 與訓練細節,補上 T2I 研究可複現缺口。

帶走什麼:簡單資料混合與較大 text encoder adapters,可撐起強 T2I 模型。

下一步:先讀實驗設計與 ablation,作為開源 T2I baseline。

Lens:重新思考基礎 Text-to-Image 模型訓練效率

效率標竿

為什麼重要:在 CVTG-2K、LongText-Bench、OneIG-EN 等榜單表現靠前。

帶走什麼:T2I 不只比畫質,也在長文字與文字準確性上被嚴格評測。

下一步:對照 leaderboard 指標,看它如何處理文字生成圖像。

CARVE:長影片 RAG 應該取回什麼、又該怎麼用

影片RAG

為什麼重要:在 V-RAGBench 的 Pass Rate、NDCG@5、Recall@5 皆列第一。

帶走什麼:長影片理解的瓶頸不只是 generator,而是 retrieval 與使用方式。

下一步:重點看 retrieval target、reranking 與 generator 接合方式。

Geometric Context Transformer:串流 3D 重建需要幾何脈絡

串流重建

為什麼重要:針對 streaming online 3D reconstruction,在 ETH3D relative 排名第一。

帶走什麼:即時 3D 重建需要把局部觀測放進幾何脈絡中累積。

下一步:看它如何維持 streaming 狀態與幾何一致性。

Causal World Modeling:讓機器人控制看見因果世界

因果控制

為什麼重要:在 LIBERO-Long success rate 達 98.5,顯示長任務控制潛力。

帶走什麼:機器人若能建模因果世界,可能更穩定處理長序列任務。

下一步:先看 LIBERO 設定、finetuning 條件與失敗案例。