跳到主要內容
AI 武林
影片高階EN3.4 萬 次觀看

DeepSeek Splits the Transformer in Two. Here’s Why.

來源 Jia-Bin Huang人物 Jia-Bin Huang

看影片(在新分頁開啟原站)連到 YouTube・Jia-Bin Huang

摘要

DeepSeek-V4.1-Flash 透過因果編碼器 - 解碼器架構、壓縮稀疏注意力與層間共享技術,將 KV Cache 縮減至每 token 890 bytes。影片詳細拆解其原理,讓讀者了解如何高效處理長上下文與代理任務。

This talk explains how DeepSeek-V4.1-Flash uses causal encoder-decoder architecture and compressed sparse attention to drastically reduce KV cache size for efficient long-context inference.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 採用因果編碼器 - 解碼器架構縮減預填充計算量。
  • 以壓縮稀疏注意力與層間共享大幅降低 KV Cache 大小。
  • 透過有界重播技術平衡長上下文與記憶體成本。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00DeepSeek V4.1-Flash
  2. 00:14Decoder-only transformer
  3. 02:16Causal encoder-decoder (CED)
  4. 04:00Compressed Sparse Attention (CSA)
  5. 08:50Cross-layer Sharing: Full, Reindex, and Reuse
  6. 10:17The 40-layer model
  7. 12:14Global KV cache vs local sliding window
  8. 14:54SWA bounded replay

提到的工具與公司

  • DeepSeek-V4.1-Flash
  • YOCO
  • FP4
  • CSA

適合誰看

正在研究大型語言模型架構最佳化、KV Cache 壓縮技術或開發長上下文應用開發者的工程師與研究者。

摘要依據

講者
Jia-Bin Huang
依據
人工字幕

為什麼排在這裡

人氣
0.73
新鮮
0.97

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)