看影片(在新分頁開啟原站)連到 3Blue1Brown
摘要
深入解析大型語言模型如何透過多層感知器儲存事實,以「喬丹打籃球」為例,說明向量空間中方向如何編碼資訊。觀眾能理解機器學習中線性變換與非線性函式(如 ReLU)如何協作,以及超位置理論如何讓模型在有限維度內儲存更多特徵。
This video explains how large language models store facts inside their multi-layer perceptrons using vector directions and non-linear functions.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 大型語言模型的事實儲存於多層感知器的向量計算中。
- 透過線性變換與非線性函式,模型可將特定事實編碼為向量方向。
- 超位置理論解釋了模型如何在高維空間中儲存遠超維度數量的資訊。
章節
依話題轉折切分,標題由 AI 產生
提到的工具與公司
- ReLU
- GELU
- Backpropagation
- DeepMind
適合誰看
對機器學習原理、Transformer 架構或 AI 可解釋性有興趣的開發者或研究者。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.90
- 新鮮
- 0.60
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Transformers, the tech behind LLMs | Deep Learning Chapter 5影片 ・ 3Blue1Brown ・ 27 分鐘(在新分頁開啟原站)
- Vector Search with LLMs - Computerphile影片 ・ Computerphile ・ 20 分鐘(在新分頁開啟原站)
- Reiner Pope – The math behind how LLMs are trained and servedPodcast ・ Dwarkesh Podcast ・ 2 小時 14 分
- Building makemore Part 2: MLP影片 ・ Andrej Karpathy ・ 1 小時 16 分(在新分頁開啟原站)
- 【生成式AI時代下的機器學習(2025)】第七講:DeepSeek-R1 這類大型語言模型是如何進行「深度思考」(Reasoning)的?影片 ・ Hung-yi Lee ・ 1 小時 18 分(在新分頁開啟原站)
- Training large language models to reason in a continuous latent space – COCONUT Paper explained影片 ・ AI Coffee Break with Letitia ・ 10 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
