看影片(在新分頁開啟原站)連到 Zhang Xiaojun Podcast
其他版本:Podcast 版(在新分頁開啟)
摘要
本集播客由孫宇領讀 Kimi K3 技術報告,該報告提出沿序列、深度與寬度三個維度擴充套件的 MoE 架構。報告指出 K3 透過將注意力機制從 token 切分為值域桶並進行統計,實現了高效擴充套件,同時採用全量訓練以確保訓練穩定性與相容性。
This podcast episode features Sun Yutao reading the Kimi K3 technical report, which proposes a MoE architecture expanding along sequence, depth, and width dimensions. The report highlights how K3 achieves efficient expansion by segmenting attention mechanisms into value buckets for statistics, while…
重點
- Kimi K3 提出沿序列、深度與寬度三個維度擴充套件 MoE 架構。
- 報告透過將注意力機制切分為值域桶並進行統計,實現高效擴充套件。
- 採用全量訓練確保模型訓練穩定性與相容性。
章節
依話題轉折切分,標題由 AI 產生
- 00:00領讀 Kimi K3 技術報告:從架構創新聊起
- 03:22模型引數量與推理效能的關鍵差異
- 39:06MLA 訓練穩定性的控制策略
- 46:05DenseNet 與 HyperConnection 的連線方式
- 50:46MoE 架構的穩定性挑戰與解決方案
- 1:04:32Latent ME 設計與 FFN 的投影最佳化
- 1:12:39Sparse Attention 的過載問題與 GLM 創新
- 1:19:03Learning Rate 策略與 Mini CPM 的切換
- 1:24:02長上下文中的位置編碼與 RoPE 侷限
- 1:29:42OPT 的蒸餾策略與工程化應用
- 1:33:57MTP 架構的訓練效率與推理加速
- 1:46:32KDA 的 CP 設計與 Kernel 級別最佳化
- 1:54:59Mini 最佳化中的 Rank 儲存與 Overlap 處理
提到的工具與公司
- Kimi K3
- MoE
- Adam
- LatentMoE
適合誰看
對大模型架構創新、MoE 模型及訓練穩定性感興趣的技術愛好者。
摘要依據
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.46
- 新鮮
- 0.87
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- not much happened today文章 ・ AINews(Latent Space/smol.ai)
- 177: 详解Kimi K3:强到冲击Anthropic估值的模型什么样?Podcast ・ 晚点聊 LateTalk ・ 1 小時 55 分(在新分頁開啟原站)
- not much happened today文章 ・ AINews(Latent Space/smol.ai)
- 【闪客】深入解读 Kimi 爆火论文,马斯克都转了!到底什么是注意力残差?白话解读哟影片 ・ 飞天闪客 ・ 8 分鐘(在新分頁開啟原站)
- 94. 逐篇讲解DeepSeek、Kimi、MiniMax注意力机制新论文——“硬件上的暴力美学”Podcast ・ 张小珺Jùn|商业访谈录 ・ 2 小時 36 分(在新分頁開啟原站)
- Kimi K3 in 10 Minutes影片 ・ Developers Digest ・ 10 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
