HF 論文速讀 2026-07-02

生成模型端到端訓練、服務優化與自主適應成為主流。
今天論文聚焦影像影片生成聯合訓練、串流服務、VLA單次適應、資料混合因果推論,以及模型自主訓練代理。
今天先記三件事
- GEAR 用 dual readout 讓 AR 模型引導 tokenizer,解決傳統兩階段 decoupling。
- TurboServe 專為串流影片生成設計,處理 session 放置與 GPU 自動擴展。
- DART 只需一個 demo 就能用 weight arithmetic 適應 VLA 環境或機器人變化。
五篇速讀
GEAR:讓影像 tokenizer 跟生成器一起學
影像生成端到端訓練
為什麼重要:傳統 tokenizer 先 train 再 freeze,AR 無法反向引導;GEAR 用硬分支 train AR、軟分支 alignment 回傳梯度。
帶走什麼:AR 模型反過來塑造 tokenizer 的 index distribution,讓生成更容易預測。
下一步:關注 VQ-AR 聯合訓練在 image synthesis 的後續實驗。
TurboServe:串流影片生成的低延遲排程系統
影片生成 servin…
為什麼重要:串流影片需長期 session 狀態、chunk 低延遲,傳統 LLM serving 無法處理 session 異質性與需求波動。
帶走什麼:migration-aware placement 加上 load-driven autoscaling,同時解決放置與 GPU 預算問題。
下一步:追蹤 TurboServe 開源後的多用戶多 GPU 實測結果。
DART:一個 demo 就讓 VLA 適應新環境
VLA 單次適應方法
為什麼重要:環境或機器人變化時,VLA 通常需多個 demo 重 train;DART 用 subspace alignment 抽取 domain 資訊做 weight arithmeti…
帶走什麼:只需單一 demonstration,就能有效適應 camera pose 與 embodiment shift。
下一步:查看 GitHub 程式碼,測試在自己機器人上的 one-shot 效果。
CausalMix:把資料配方變成因果推論問題
LLM 資料混合優化
為什麼重要:資料混合權重依賴 proxy model,資料池改變就需重 train;CausalMix 把 mixture 當 treatment,用 CATE 動態推斷。
帶走什麼:在 Qwen2.5-0.5B 上 fit causal model,再 extrapolate 到 7B 與 long CoT 資料。
下一步:注意 CausalMix 在更大模型與不同資料池的泛化表現。
AutoTrainess:把模型訓練經驗做成 Agent 介面
自主 post-tra…
為什麼重要:自主訓練不只是 coding,需要 plan、data prep、training、eval 完整 workflow;CLI 環境太 underspecified。
帶走什麼:把人類經驗外化成明確 interfaces,在 PostTrainBench 得分明顯高於純 CLI baseline。
下一步:關注 AutoTrainess 在不同 base model 與 harness 上的泛化結果。