穗稻忠武的專欄
HF 速讀AI 論文

HF 論文速讀 2026-08-05

HF 論文速讀 2026-08-05

今天焦點是以更高效率支撐推理、Agent 與長上下文,且競爭已從單一模型能力延伸至 MoE、diffusion 與混合架構。

下一代開放模型正用 MoE、Mamba-Transformer 與 diffusion decoding,把推理、程式、Agent 與百萬級上下文能力推向更高效的共同戰場。

今天先記三件事

  1. 效率成主軸:MoE 的總參數規模很大,但以較少 active parameters 執行。
  2. 長上下文不只比長度,也比真實檢索與理解,LongBench v2、RULER 是關鍵訊號。
  3. diffusion LLM 已不只是研究概念,iLLaDA 在數學、程式與通識評測展現競爭力。

五篇速讀

改良大型語言 Diffusion 模型

Diffusion L…

為什麼重要:iLLaDA-8B-Instruct 在 MATH、GSM8k、HumanEval 與 MMLU-Redux 均有前段成績,顯示非自回歸生成正逼近主流 LLM。

帶走什麼:7.62B 模型採可變長度 diffusion decoding;模型生成路徑與訓練後處理,可能和參數量同樣重要。

下一步:先讀 Appendix A 的 block length 與解碼流程,再比較它和 autoregressive decoding 的品質、…

DeepSeek-V4:高效率百萬 Token 上下文智慧

長上下文旗艦

為什麼重要:DeepSeek-V4 以 1.6T total、49B active 的 MoE 規模,並在 MMLU-Pro 與 SimpleQA-Verified 取得領先訊號。

帶走什麼:大模型競爭不等於每次都啟用全部參數;高容量與較低 active compute 可同時追求。

下一步:優先查看 Table 7,分開檢視 Max reasoning effort 的結果與一般推理部署成本。

Nemotron 3 Ultra:面向 Agentic Reasoning 的 MoE Hybrid Mamba-Transformer

混合架構 Agent

為什麼重要:550B total、55B active 的 MoE Hybrid 架構,在 LongBench v2、RULER 與 MMLU-Pro 都具強勁表現。

帶走什麼:Mamba-Transformer 混合設計的價值,在於把長序列處理與 Agent 推理需求放進同一架構目標。

下一步:若做 Agent 或長文件任務,優先對照 LongBench v2 與 RULER,而非只看通識分數。

Ling and Ring 2.6 技術報告:兆參數級高效率即時 Agent 智慧

即時 Agent

為什麼重要:報告把兆參數尺度、效率與即時 Agent 能力放在同一命題,並在 SuperGPQA、LongBench v2 有前段訊號。

帶走什麼:Agent 模型的評價開始同時要求專業問答、長文本理解與回應效率,單一 benchmark 已不足夠。

下一步:先讀 Table 5 的 LongBenchV2 設定,確認評測任務是否貼近你的長脈絡 Agent 工作流。

GLM-4.5:Agentic、Reasoning 與 Coding 基礎模型

ARC 綜合模型

為什麼重要:GLM-4.5 把 Agentic、Reasoning、Coding 整合為 ARC 定位,並在 GPQA 與 MATH 500 顯示強勢成績。

帶走什麼:評測數字要讀協議:GPQA 的 79.1 是 Avg@8 加自動答案驗證,不能直接視為單次作答分數。

下一步:比較時先標記 Avg@8、Pass@1 與不同資料集子集,避免把不等價數字放在同一排名。