跳到主要內容
AI 武林
影片高階EN9,976 次觀看

Stanford CS229 Machine Learning | Spring 2026 | Lecture 16: Basic Concept in RL, Policy Gradient

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

回顧 Transformer 架構並深入探討注意力機制最佳化,包括 KV Cache 管理與 Group Query Attention。同時介紹大語言模型的 SFT、指令調教及混合專家(MoE)架構,說明如何透過路由機制提升模型效率與專精度。

This lecture reviews Transformer architecture, discusses KV Cache optimization, and explains MoE and SFT techniques for large language models.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 回顧 Transformer 架構與注意力計算細節。
  • 介紹 Group Query Attention 與混合專家(MoE)架構。
  • 說明 SFT 與指令調教對大語言模型的影響。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:06Transformer 架構最佳化與自回歸特性
  2. 05:30KV Cache 記憶體限制與批次大小
  3. 08:10共享 Key 與 Value 的群組注意力機制
  4. 15:34內積尺度因子 c 的平方根選擇原理
  5. 18:06生成階段查詢記憶體成本分析
  6. 25:28滑動視窗注意力解決二次計算問題
  7. 30:13內積正規化技巧與專家混合架構
  8. 33:28專家混合架構的訓練與擴展挑戰
  9. 48:30動態分配 GPU 資源提升推理效率
  10. 51:28情境學習與提示工程應用方式
  11. 1:01:47企業級模型微調與部署流程
  12. 1:05:43指令跟隨與監督微調損失函式
  13. 1:08:50人機協作中指令與思考過程界定
  14. 1:11:43專家微調策略與前沿實驗室做法

提到的工具與公司

  • SFT

適合誰看

正在學習機器學習理論或開發大語言模型相關技術的開發者與研究者。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.61
新鮮
0.78

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)