穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-08-03

HF 論文速讀 2026-08-03

今天的核心趨勢是:把原本難以直接評分、難以端到端最佳化的生成與開放任務,轉成可探索、可歸因或可驗證的訓練訊號。

生成模型與 LLM 的下一輪進步,關鍵不只在模型與資料,而在如何設計更有效的探索、偏好、歸因與可驗證回饋。

今天先記三件事

  1. Explorative Modeling 將探索次數變成參數、資料之外的第三個 pretraining scaling 軸。
  2. RLSVR 以任務轉換建立自我可驗證獎勵,試圖把 RLVR 擴展到開放式任務。
  3. AISPA 審計 88 個商業產品 prompt,發現保護性指令普遍存在但覆蓋面常不足。

五篇速讀

探索式建模:解鎖第三個預訓練軸與端到端生成

生成訓練新範式

為什麼重要:它不分解生成流程,而是在訓練時探索 K 個候選匹配、選最佳者學習,讓預測更能貼近多模態分布。

帶走什麼:探索量可成為 parameters、data 之外的 scaling 軸;摘要稱其在影像、影片、語言皆隨探索增加而提升。

下一步:先看 K 候選與最佳匹配的訓練機制,再檢查其跨模態與 Offline RL 結果。

透過區域感知雙模態 Direct Preference Optimization 的組合式文字生成影像

組合式 T2I 對齊

為什麼重要:此工作聚焦文字到影像的組合性對齊,並在 T2I-CompBench 的 Non-Spatial、Spatial、Shape 項目列第一。

帶走什麼:整體圖像偏好不足以保證物件、顏色、形狀與空間關係正確;區域層級訊號是值得追蹤的方向。

下一步:優先核對 region-aware 與 bimodal DPO 如何定義偏好對,以及各子項的失敗案例。

用於離散策略最佳化的 Guidance Contrastive Token Credit Assignment

Token 級 RL…

為什麼重要:它處理離散策略最佳化中的 token credit assignment,並在 MathVerse 取得 84.1 Accuracy 的榜首成績。

帶走什麼:推理 RL 的難點不只是最終答案對錯,而是如何把回饋分配給真正促成正解的 token 決策。

下一步:閱讀其 guidance contrastive 設計,確認 token 級歸因相對於序列級 reward 的實際改善來源。

從 RLVR 到 RLSVR:以任務轉換誘發自我可驗證獎勵的開放式 LLM 自我改進

開放任務 RL

為什麼重要:RLSVR 將開放任務改造成規則可驗證的代理環境,減少對人類偏好、reward model 與 LLM judge 的依賴。

帶走什麼:SpyRL 利用非對稱資訊與預先指定的 spy 身分,自動產生可驗證投票結果作為訓練訊號。

下一步:重點檢驗代理任務的 reward 是否真能遷移至原始開放任務,而非只學會環境規則。

AISPA:以使用者為中心的大型語言模型應用 System Prompt 審計

Prompt 治理審計

為什麼重要:AISPA 提出八個使用者相關維度,並分析 88 個商業產品的 3,249 條 system prompt 指令。

帶走什麼:98.9% 產品至少有一條保護性指令,但僅 24% 覆蓋全部八個 AISPA 維度,顯示保護常流於片段化。

下一步:若你在做 AI 產品治理,可將八維分類轉成 prompt review checklist 與發版門檻。