影片高階中文9.3 萬 次觀看
【生成式AI時代下的機器學習(2025)】第四講:Transformer 的時代要結束了嗎?介紹 Transformer 的競爭者們
看影片(在新分頁開啟原站)連到 Hung-yi Lee
摘要
李宏毅教授探討 Transformer 架構的競爭對手,分析 Mamba 等序列模型如何挑戰 Self-Attention。課程解釋了不同神經網路架構存在的設計理由,並討論了從現有大模型微調以測試新架構的趨勢。
This lecture explores competitors to the Transformer architecture, focusing on Mamba and other sequence models, and discusses trends in fine-tuning existing models to test new designs.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- Transformer 的競爭對手包括 Mamba 等序列狀態模型。
- 不同架構因特定理由被設計,如減少參數或最佳化訓練。
- 趨勢是從現有語言模型微調,測試移除 Self-Attention 的效果。
章節
依話題轉折切分,標題由 AI 產生
- 00:00Transformer 架構應用與課程主題
- 02:56Residual Connection 與前大爆發時期
- 06:58Self-Attention 取代 RNN 的演進
- 17:10Self-Attention 平行計算優勢解析
- 24:31訓練原理與參數更新機制
- 27:54Self-Attention 平行化訓練效率
- 42:01Linear Attention 歷史與架構簡化
- 58:14動畫劇情回顧與獵人協會記載差異
- 1:01:29引入 Gamma 機制讓記憶逐漸淡忘
- 1:04:22設計 GT 矩陣操控記憶被記得或遺忘
- 1:07:31Mamba 架構出現及其平行化訓練挑戰
- 1:11:46DeltaNet 將記憶更新視為梯度下降
- 1:16:31GEMBA 模型驗證 Mamba 在分類任務表現
- 1:21:362027 年 Transformer 霸榜命運賭約
提到的工具與公司
- Mamba
- RNN
- LSTM
- CNN
適合誰看
正在學習機器學習架構、準備相關課程作業或研究新模型趨勢的人。
摘要依據
- 講者
- 李宏毅
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.57
- 新鮮
- 0.12
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- MIT 6.S191 (2024): Recurrent Neural Networks, Transformers, and Attention影片 ・ Alexander Amini ・ 1 小時 2 分(在新分頁開啟原站)
- Mamba and S4 Explained: Architecture, Parallel Scan, Kernel Fusion, Recurrent, Convolution, Math影片 ・ Umar Jamil ・ 1 小時 14 分(在新分頁開啟原站)
- 从编解码和词嵌入开始,一步一步理解Transformer,注意力机制(Attention)的本质是卷积神经网络(CNN)影片 ・ 王木头学科学 ・ 1 小時 45 分(在新分頁開啟原站)
- Attention? Attention!文章 ・ Lilian Weng(部落格)
- The Transformer Family文章 ・ Lilian Weng(部落格)
- Stanford CME295 Transformers & LLMs | Autumn 2026 | Lecture 1 - Transformers影片 ・ Stanford Online ・ 1 小時 44 分(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
