穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-07-03

HF 論文速讀 2026-07-03

非對比學習、模糊函式編譯與模型效率加速是今日共同趨勢

AI 模型正朝向不用負樣本、輕量本地執行與免訓練加速的方向快速演進

今天先記三件事

  1. LeVLJEPA 首創非對比端到端視覺語言預訓練
  2. PAW 把模糊任務編譯成 0.6B 小型權重 artifact
  3. FlashMorph 與 MrFlow 分別優化 Transformer 與擴散模型效率

五篇速讀

LeVLJEPA:不用負樣本的視覺語言預訓練

非對比視覺語言預訓練

為什麼重要:首個完全非對比端到端方法,透過 cross-modal prediction 與 distributional regularization 學習穩定特徵

帶走什麼:凍結 backbone 在 GQA、VQAv2、POPE 表現最強,優於對比基線於語義分割任務

下一步:直接作為凍結視覺 backbone 測試下游 VLM 與密集預測任務

Program-as-Weights:把模糊函式編譯成小型權重

模糊函式程式設計典範

為什麼重要:4B compiler 在 FuzzyBench 產生 adapters,讓 0.6B interpreter 匹配 32B 模型效能,記憶體減約五十倍

帶走什麼:把 foundation model 從 per-input solver 轉為工具建造者,產生可重用小型本地 artifact

下一步:在本地 MacBook M3 以 30 tokens/s 執行模糊任務如 log 分析或 JSON 修復

AgenticDataBench:資料代理人的完整測驗場

資料代理 benchm…

為什麼重要:涵蓋 15 垂直領域真實任務,含 5 個 fintech B2B 用例,提供細粒度 ground-truth 評估

帶走什麼:填補 LLM-based data agents 評估缺口,能捕捉工作流程多樣性與複雜度

下一步:用來 rigorously evaluate 各 data agent 在真實資料科學流程的表現

FlashMorph:把 Transformer 變成混合注意力模型

Transformer…

為什麼重要:將 layer selection 視為預算受限子集優化問題,透過 gates 與 linearization regularization 學習

帶走什麼:在合成長上下文檢索資料上優化,實現高效 hybrid 配置並保留關鍵 full-attention layers

下一步:應用於長上下文模型轉換,提升效率同時維持效能

MrFlow:免訓練的多解析度 Flow Matching 加速

免訓練擴散加速方法

為什麼重要:採用 staged low-to-high resolution pipeline,結合 GAN super-resolution 與 low-strength noise in…

帶走什麼:在 FLUX.1-dev 與 Qwen-Image 上利用低解析 quadratic token reduction 達成顯著加速並減少 artifacts

下一步:直接套用於 pretrained flow-matching 模型,無需額外訓練即可加速 text-to-image 推論