HF 論文速讀 2026-07-24

文件理解與 Agent 檢索從單點相關性,轉向集合品質、多代理協作與高效多模態編碼。
今天重點:為 Agent 評「文件集合」而非單篇、凍結視覺編碼器做分割,以及多代理/輕量 VL 在長文件與 OCR 上刷榜。
今天先記三件事
- 單篇 nDCG 不夠:集合冗餘、衝突、互補才決定下游生成上限。
- 凍結強大 ViT + 輕量 Mask Decoder,仍可在影片語意分割拿高分。
- 文件 VQA 靠多代理 test-time scaling 與高效 VL,長文件/資訊圖持續刷 SOTA。
五篇速讀
超越相關性中心檢索:以評分尺規導向的文件集合挑選與排序
集合檢索新範式
為什麼重要:LLM/Agent 吃的是整組結果;既有 nDCG 忽略冗餘、衝突與互補,評不出誰的集合更好。
帶走什麼:SetwiseEvalKit 九維約 28K rubrics;12 家 reranker 最佳覆蓋仍≤45%;Rubric4Setwise 免訓練、更少文件卻更好下游生成。
下一步:把評分尺規轉成選集訊號,重做 Agent 檢索評估與重排,別只盯單篇相關分數。
PMT:凍結視覺編碼器的 Plain Mask Transformer 影像與影片分割
凍結編碼分割
為什麼重要:用凍結 DINOv3-L 加輕量 Plain Mask Decoder,在線影片語意分割仍具競爭力並報 VSPW 領先。
帶走什麼:PMT-L:ViT-L/16 凍結、六層 decoder、五幀窗與 query 傳播;VSPW mIoU 65.7、YT-VIS2019 AP 69.2。
下一步:影片分割優先試凍結強編碼器+薄 decoder,對照官方 VSPW checkpoint 與設定。
OneVision-Encoder:編解碼對齊稀疏作為多模態智能基礎原則
多模態編碼原則
為什麼重要:主張 codec-aligned sparsity 作基礎;以受控原生解析度編碼器探測 OCR 能力並報榜。
帶走什麼:OCRBench v2 全資料 Accuracy 30.8(約第2);公開多為視覺編碼器,完整對齊複合體未釋出。
下一步:做 OCR/文件多模態時評估稀疏與 codec 對齊;HF 上先拿 encoder 做 probe 實驗。
視覺文件理解與問答:測試時擴展的多代理協作框架
多代理文件VQA
為什麼重要:規劃/執行/判斷/回答四代理,加自適應 test-time scaling,在多個文件理解榜單領先。
帶走什麼:DUDE ANLS 72.5、InfoVQA 89.4、DocVQA 96.6;典型 Np=16、Ne=16、判斷觸發最多3次修正。
下一步:文件 QA 可拆四角色並加測試時路徑與判斷迴圈,用混合基準微調代理。
NVIDIA Nemotron Nano V2 VL
輕量長文件VL
為什麼重要:Nemotron Nano V2 VL 在長文件與資訊圖理解零樣本設定交出可複現高分。
帶走什麼:MMLongBench-Doc 準確率 32.1(報第1);InfoVQA ANLS 80.4(報第2);取推理關閉、全集合 zero-shot。
下一步:長文件/掃描檔管線可對照該技術報告的 zero-shot 設定與 Nano VL 權衡。