跳到主要內容
AI 武林
影片入門中文12.4 萬 次觀看

【生成式人工智慧與機器學習導論2025】第3講:解剖大型語言模型

來源 Hung-yi Lee人物 李宏毅 Hung-yi Lee

看影片(在新分頁開啟原站)連到 Hung-yi Lee

摘要

深入剖析大型語言模型內部運作原理,從 Token 化到 Embedding 表,再到 Attention 機制與層級結構。透過實際解剖已訓練好的模型,讓讀者理解模型如何將輸入句子轉化為下一個 Token 的機率分佈,並透過實作範例觀察不同模型的注意力分配模式。

This lecture dissects the internal workings of large language models, explaining tokenization, embeddings, and attention mechanisms with practical demonstrations.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 詳細解說語言模型從輸入到輸出的內部運作流程
  • 剖析 Embedding 表與 Attention 機制的具體原理
  • 透過實作範例觀察不同模型的注意力分配行為

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00剖析語言模型內部運作機制
  2. 03:19假設中文字為 Token 進入 Embedding
  3. 10:57探討多層神經網路之優勢與原理
  4. 14:58解釋 Logit 轉機率之 Softmax 過程
  5. 18:50說明溫度參數如何影響創意模式
  6. 44:37介紹 Logit Lens 解讀中間層意涵
  7. 54:23解析 Transformer 架構中 Attention 層
  8. 58:02計算「果」字時如何識別上下文影響
  9. 1:03:23引入位置嵌入處理序列順序資訊
  10. 1:05:54計算自注意力與數值大小代表影響
  11. 1:15:18解析雙層前饋神經元的運算機制
  12. 1:20:13探討神經元矩陣運算與 AI 起源
  13. 1:39:21觀察 Token 嵌入如何對映同義詞
  14. 1:52:47檢視隱藏表示與 LM Head 輸出預測

提到的工具與公司

  • Llama
  • Gemma
  • RoPE
  • Colab

適合誰看

正在學習機器學習原理或希望深入理解大型語言模型內部結構的開發者與研究者。

摘要依據

講者
李宏毅
依據
人工字幕

為什麼排在這裡

人氣
0.63
新鮮
0.24

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)