跳到主要內容
AI 武林
影片高階EN469 萬 次觀看

Attention in transformers, step-by-step | Deep Learning Chapter 6

來源 3Blue1Brown

看影片(在新分頁開啟原站)連到 3Blue1Brown

摘要

詳細拆解 Transformer 模型中的注意力機制,包括自注意力、多頭注意力與交叉注意力的運作原理。透過具體範例說明上下文如何影響詞彙意義,並解釋如何透過矩陣運算更新嵌入向量,讓模型理解更豐富的語境資訊。

A step-by-step visual explanation of the attention mechanism in Transformers and LLMs.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 解釋自注意力與多頭注意力的計算流程與數學原理
  • 說明掩碼機制如何防止後續詞影響先前詞的預測
  • 分析注意力機制對上下文大小與參數量的影響

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00Recap on embeddings
  2. 01:39Motivating examples
  3. 04:29The attention pattern
  4. 11:08Masking
  5. 12:42Context size
  6. 13:10Values
  7. 15:44Counting parameters
  8. 18:21Cross-attention
  9. 19:19Multiple heads
  10. 22:16The output matrix
  11. 23:19Going deeper
  12. 24:54Ending

適合誰看

正在學習深度學習、機器學習或大語言模型架構的開發者與研究者。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.93
新鮮
0.60

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)