HF 論文速讀 2026-07-29

今天焦點是以更強的上下文建模,同時推進長程 AI 智能與高效率影音基礎設施。
Kimi K3 把長上下文、視覺與 Agent 能力推向開放前沿;三篇 Neural Video Compression 論文則證明上下文建模正直接轉成更低碼率。
今天先記三件事
- Kimi K3 以 2.8T MoE、104B activated parameters 與 1M context 瞄準長程 Agent。
- 影片壓縮競賽的核心從單幀預測,轉向跨多幀、非局部與調制式上下文。
- GNM Head 補齊眼球、牙齒與舌頭,讓人頭 3D conditioning 更完整。
五篇速讀
GNM Head:生成式人體測量人頭模型
3D 人頭底模
為什麼重要:把頭、臉、頸部、眼球、牙齒與舌頭納入同一參數模型,補上既有公開模型常忽略的內部解剖結構。
帶走什麼:高品質、解剖完整的人頭表示,可成為重建、動畫與生成式視覺模型空間控制的基礎。
下一步:若做數位人或可控人像生成,優先查看其 fitting 表現與公開框架。
ECVC:利用多幀非局部關聯的上下文影片壓縮
跨幀壓縮
為什麼重要:以多幀非局部關聯建立 contextual video compression,在 HEVC Class B、C、D 多項 RGB 評測居首。
帶走什麼:遠距時間關聯是影片壓縮的重要訊號;只看鄰近影格,可能遺漏可降低碼率的重複資訊。
下一步:比較其跨幀 context 設計,並留意評測採 RGB、BT.601、96-frame 與 VTM-13.2 LDB。
Neural Video Compression with Context Modulation
調制式壓縮
為什麼重要:透過 Context Modulation 做神經影片壓縮,在 HEVC Class E RGB 評測取得第一,其餘三組排名第二。
帶走什麼:上下文不只是額外特徵,也能以 modulation 方式動態改變編解碼行為,適配不同畫面內容。
下一步:若研究 learned codec,對照 ECVC 的非局部關聯與本篇的 context modulation 取捨。
Kimi K3:開放前沿智能
開放 MoE 前沿
為什麼重要:2.8T MoE、每 token 啟用 104B 參數、原生視覺與 1M context,並主打長程 coding、Agent 與推理能力。
帶走什麼:Kimi K3 的重點不只模型規模,而是以 Delta Attention、Attention Residuals、Stable LatentMoE 與系統協同支撐長程執行。
下一步:先讀架構與 Agentic RL 段落,再核對長程 coding、Agent、vision 評測及開放使用條件。
邁向實用即時神經影片壓縮
即時部署壓縮
為什麼重要:DCVC-RT Large 在 HEVC Class B 至 E 的低延遲 YUV420 實際位元流評測皆排名第一。
帶走什麼:神經影片壓縮開始把「實際 bitstream、header 與即時性」納入核心問題,而非只追求理想化離線指標。
下一步:評估部署可行性時,優先看 actual bitstream、FP16 設定與低延遲 all-frame 條件。