影片高階EN17.1 萬 次觀看
Stanford CS229 Machine Learning | Spring 2026 | Lecture 14: Transformers, In-Context Learning
看影片(在新分頁開啟原站)連到 Stanford Online
摘要
深入解析大型語言模型的自迴歸特性、分詞技術(如 BPE)及 Transformer 架構細節,涵蓋訓練損失函式、溫度參數對生成的影響,並探討長上下文下的計算複雜度與 Flash Attention 等最佳化策略。
This lecture covers the fundamentals of autoregressive large language models, tokenization techniques, Transformer architecture, and optimization strategies for long contexts.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 介紹自迴歸大型語言模型的基礎原理與分詞機制。
- 解析 Transformer 架構、訓練方法與生成時的溫度參數。
- 討論長上下文帶來的平方級計算複雜度與最佳化方案。
章節
依話題轉折切分,標題由 AI 產生
提到的工具與公司
- CS229
- GPT-3
- BPE
- SGD
- Adam
- OpenAI Tokenizer
適合誰看
正在學習機器學習理論、準備深入理解 Transformer 架構的學生或研究者。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.87
- 新鮮
- 0.78
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Stanford CME295 Transformers & LLMs | Autumn 2026 | Lecture 1 - Transformers影片 ・ Stanford Online ・ 1 小時 44 分(在新分頁開啟原站)
- MIT 6.S191 (2025): Large Language Models (Google)影片 ・ Alexander Amini ・ 56 分鐘(在新分頁開啟原站)
- Attention in transformers, step-by-step | Deep Learning Chapter 6影片 ・ 3Blue1Brown ・ 26 分鐘
- 【生成式AI導論 2024】第10講:今日的語言模型是如何做文字接龍的 — 淺談Transformer (已經熟悉 Transformer 的同學可略過本講)影片 ・ Hung-yi Lee ・ 38 分鐘
- Attention? Attention!文章 ・ Lilian Weng(部落格)
- Recurrence and Attention for Long-Context Transformers with Jacob Buckman - #750Podcast ・ The TWIML AI Podcast ・ 57 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
