聽節目(在新分頁開啟原站)連到 晚点聊 LateTalk
摘要
訪談由 RadixArk 工程師與 UCLA 博士生,深入解析 DeepSeek V4 技術細節。內容涵蓋放棄 MLA 架構改用混合稀疏注意力、Muon 最佳化器、mHC 及 FP4 等工程創新,探討如何讓百萬上下文從理論走向實用,並分析其對業界架構演進的影響。
An in-depth interview analyzing DeepSeek V4's technical innovations, including new attention mechanisms and optimization techniques that enable practical million-context handling.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- DeepSeek V4 放棄 MLA 架構,採用混合稀疏注意力機制。
- 引入 Muon 最佳化器與 mHC 技術,提升訓練穩定性。
- 透過 TileLang 與 FP4 最佳化,大幅降低推理成本。
章節
依話題轉折切分,標題由 AI 產生
- 00:00DeepSeek V4 架構革新與工程最佳化
- 07:44訓練成本隱形與技術探索成本
- 12:36範式敘事疲乏與工程組合創新
- 16:41長上下文效率與雙盲測試表現
- 33:56稀疏注意力機制與滑動視窗最佳化
- 40:09矩陣層最佳化器與訓練穩定性
- 47:51MHC 架構提升推理速度與能力
- 54:23TileWave 與 Split Kernel 最佳化推理效率
- 1:01:48FP4 精度壓縮如何降低算力與視訊記憶體需求
- 1:06:08量化感知訓練與 W4A4 極致壓縮方案
- 1:09:15FP4 成工業標準與多模型支援整合挑戰
- 1:12:26專家聚合技術與模型蒸餾實踐分析
- 1:19:24Benchmark 過時與真實評估能力關鍵
- 1:33:17行業模型快速迭代與架構趨同趨勢
提到的工具與公司
- DeepSeek V4
- SGLang
- RadixArk
- MLA
- MQA
- Muon
- mHC
- TileLang
適合誰看
適合對大模型架構、推理最佳化及工程實踐感興趣的開發者與研究者。
摘要依據
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.55
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- The Insane Infrastructure Design of DeepSeek V4影片 ・ bycloud ・ 27 分鐘(在新分頁開啟原站)
- DeepSeek’s Insane New Architecture影片 ・ Two Minute Papers ・ 5 分鐘(在新分頁開啟原站)
- 【闪客】深入解读 DeepSeek V1~V4!男女老少都听得懂~影片 ・ 飞天闪客 ・ 12 分鐘(在新分頁開啟原站)
- DeepSeek V4是怎么训练出来的?73页PPT深入解析影片 ・ Alchain花生 ・ 36 分鐘(在新分頁開啟原站)
- not much happened today文章 ・ AINews(Latent Space/smol.ai)
- not much happened today文章 ・ AINews(Latent Space/smol.ai)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
