跳到主要內容
AI 武林
影片高階中文7,616 次觀看

152. 领读Kimi K3技术报告:从架构创新聊起,注意力美学、多教师蒸馏和开源MoE

來源 Zhang Xiaojun Podcast

看影片(在新分頁開啟原站)連到 Zhang Xiaojun Podcast

其他版本:Podcast 版(在新分頁開啟)

摘要

本集播客由孫宇領讀 Kimi K3 技術報告,該報告提出沿序列、深度與寬度三個維度擴充套件的 MoE 架構。報告指出 K3 透過將注意力機制從 token 切分為值域桶並進行統計,實現了高效擴充套件,同時採用全量訓練以確保訓練穩定性與相容性。

This podcast episode features Sun Yutao reading the Kimi K3 technical report, which proposes a MoE architecture expanding along sequence, depth, and width dimensions. The report highlights how K3 achieves efficient expansion by segmenting attention mechanisms into value buckets for statistics, while…

重點

  • Kimi K3 提出沿序列、深度與寬度三個維度擴充套件 MoE 架構。
  • 報告透過將注意力機制切分為值域桶並進行統計,實現高效擴充套件。
  • 採用全量訓練確保模型訓練穩定性與相容性。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00領讀 Kimi K3 技術報告:從架構創新聊起
  2. 03:22模型引數量與推理效能的關鍵差異
  3. 39:06MLA 訓練穩定性的控制策略
  4. 46:05DenseNet 與 HyperConnection 的連線方式
  5. 50:46MoE 架構的穩定性挑戰與解決方案
  6. 1:04:32Latent ME 設計與 FFN 的投影最佳化
  7. 1:12:39Sparse Attention 的過載問題與 GLM 創新
  8. 1:19:03Learning Rate 策略與 Mini CPM 的切換
  9. 1:24:02長上下文中的位置編碼與 RoPE 侷限
  10. 1:29:42OPT 的蒸餾策略與工程化應用
  11. 1:33:57MTP 架構的訓練效率與推理加速
  12. 1:46:32KDA 的 CP 設計與 Kernel 級別最佳化
  13. 1:54:59Mini 最佳化中的 Rank 儲存與 Overlap 處理

提到的工具與公司

  • Kimi K3
  • MoE
  • Adam
  • LatentMoE

適合誰看

對大模型架構創新、MoE 模型及訓練穩定性感興趣的技術愛好者。

摘要依據

依據
語音轉文字

為什麼排在這裡

人氣
0.46
新鮮
0.87

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)