跳到主要內容
AI 武林
影片入門中文9.8 萬 次觀看

【生成式AI導論 2024】第10講:今日的語言模型是如何做文字接龍的 — 淺談Transformer (已經熟悉 Transformer 的同學可略過本講)

來源 Hung-yi Lee人物 李宏毅 Hung-yi Lee

看影片(在新分頁開啟原站)連到 Hung-yi Lee

摘要

深入解析大型語言模型背後的 Transformer 架構,說明其如何透過 Tokenization 將文字轉為序列,再利用 Attention 機制計算 Token 間的關聯性與權重,最後整合輸出下一個 Token 的機率分佈。觀眾能理解語言模型「文字接龍」的運作原理,並掌握其計算複雜度與演進背景。

This course explains how language models use the Transformer architecture and Attention mechanism to generate text.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 語言模型透過 Tokenization 將句子轉為 Token 序列。
  • Attention 模組計算 Token 間關聯性並進行加權整合。
  • Transformer 架構由多個 Block 堆疊以反覆思考上下文。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00語言模型內部的 Transformer 機制
  2. 03:24文字轉 Token 與輸入層處理
  3. 09:08Token 轉向量與 Embedding 原理
  4. 12:12固定 Embedding 與上下文缺失
  5. 15:18位置嵌入與 Attention 模組引入
  6. 22:36自注意力權重計算與多頭機制
  7. 27:50輸出層將向量轉為機率分佈
  8. 32:35單向注意力機制提升計算效率
  9. 37:32混合架構結合 Transformer 與 RNN

適合誰看

正在學習機器學習原理、準備進入大語言模型領域的初學者或進階學員。

摘要依據

講者
李宏毅
依據
人工字幕

為什麼排在這裡

人氣
0.53
新鮮
0.03

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)