跳到主要內容
AI 武林
影片高階EN17.1 萬 次觀看

Stanford CS229 Machine Learning | Spring 2026 | Lecture 14: Transformers, In-Context Learning

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

深入解析大型語言模型的自迴歸特性、分詞技術(如 BPE)及 Transformer 架構細節,涵蓋訓練損失函式、溫度參數對生成的影響,並探討長上下文下的計算複雜度與 Flash Attention 等最佳化策略。

This lecture covers the fundamentals of autoregressive large language models, tokenization techniques, Transformer architecture, and optimization strategies for long contexts.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 介紹自迴歸大型語言模型的基礎原理與分詞機制。
  • 解析 Transformer 架構、訓練方法與生成時的溫度參數。
  • 討論長上下文帶來的平方級計算複雜度與最佳化方案。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:05課程大綱:LLM 與強化學習概覽
  2. 02:34分詞策略:字元、字詞與子字詞
  3. 10:21機率建模:序列分佈的條件分解
  4. 14:44嵌入表示:詞彙到向量空間的對映
  5. 17:09前向推演:Transformer 與 Softmax 輸出
  6. 26:10訓練與生成:似然度最大化與自迴歸過程
  7. 28:59溫度參數:調整生成多樣性的技巧
  8. 35:45計算負對數似然函式作為損失
  9. 39:42交替使用注意力層與多層感知機
  10. 53:51純 MLP 無法捕捉序列間依賴
  11. 57:40將查詢鍵值組織為矩陣簡化運算
  12. 1:06:13多頭注意力機制與投影合併輸出
  13. 1:11:16加入殘差連線與層歸一化結構
  14. 1:14:20解決長序列下平方複雜度問題

提到的工具與公司

  • CS229
  • GPT-3
  • BPE
  • SGD
  • Adam
  • OpenAI Tokenizer

適合誰看

正在學習機器學習理論、準備深入理解 Transformer 架構的學生或研究者。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.87
新鮮
0.78

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)