跳到主要內容
AI 武林
Podcast進階中文

163: 详解DeepSeekV4:Infra巨鲸、百万上下文走进现实、极致效率优化

來源 晚点聊 LateTalk

聽節目(在新分頁開啟原站)連到 晚点聊 LateTalk

摘要

訪談由 RadixArk 工程師與 UCLA 博士生,深入解析 DeepSeek V4 技術細節。內容涵蓋放棄 MLA 架構改用混合稀疏注意力、Muon 最佳化器、mHC 及 FP4 等工程創新,探討如何讓百萬上下文從理論走向實用,並分析其對業界架構演進的影響。

An in-depth interview analyzing DeepSeek V4's technical innovations, including new attention mechanisms and optimization techniques that enable practical million-context handling.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • DeepSeek V4 放棄 MLA 架構,採用混合稀疏注意力機制。
  • 引入 Muon 最佳化器與 mHC 技術,提升訓練穩定性。
  • 透過 TileLang 與 FP4 最佳化,大幅降低推理成本。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00DeepSeek V4 架構革新與工程最佳化
  2. 07:44訓練成本隱形與技術探索成本
  3. 12:36範式敘事疲乏與工程組合創新
  4. 16:41長上下文效率與雙盲測試表現
  5. 33:56稀疏注意力機制與滑動視窗最佳化
  6. 40:09矩陣層最佳化器與訓練穩定性
  7. 47:51MHC 架構提升推理速度與能力
  8. 54:23TileWave 與 Split Kernel 最佳化推理效率
  9. 1:01:48FP4 精度壓縮如何降低算力與視訊記憶體需求
  10. 1:06:08量化感知訓練與 W4A4 極致壓縮方案
  11. 1:09:15FP4 成工業標準與多模型支援整合挑戰
  12. 1:12:26專家聚合技術與模型蒸餾實踐分析
  13. 1:19:24Benchmark 過時與真實評估能力關鍵
  14. 1:33:17行業模型快速迭代與架構趨同趨勢

提到的工具與公司

  • DeepSeek V4
  • SGLang
  • RadixArk
  • MLA
  • MQA
  • Muon
  • mHC
  • TileLang

適合誰看

適合對大模型架構、推理最佳化及工程實踐感興趣的開發者與研究者。

摘要依據

依據
語音轉文字

為什麼排在這裡

人氣
0.50
新鮮
0.55

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)