Building a distributed training framework from first principles(在新分頁開啟原站)
從第一原理出發,使用 PyTorch 建構分散式訓練框架。影片涵蓋了分散式訓練的數學基礎、多頭注意力、旋轉位置嵌入及 YaRN 等輔助元件,並深入探討過程群、分散式梯度計算及現代語言模型的並行訓練技術。
※ 摘要僅根據標題與說明
YouTube ・ 國際 ・ 英文 ・ A 級 ・ 9.1 萬 訂閱 ・ 25 筆內容 ・ 最近更新 2026/08/18
從零實作 Transformer、LLM 論文細講
依人氣
從第一原理出發,使用 PyTorch 建構分散式訓練框架。影片涵蓋了分散式訓練的數學基礎、多頭注意力、旋轉位置嵌入及 YaRN 等輔助元件,並深入探討過程群、分散式梯度計算及現代語言模型的並行訓練技術。
※ 摘要僅根據標題與說明
本影片用繁體中文解釋了 Transformer 架構的核心原理,包括數學公式、推理與訓練過程,讓讀者理解為何 Attention 是關鍵。
※ 摘要僅根據標題與說明
本影片詳細介紹如何從零開始用 PyTorch 編寫 Transformer 模型,涵蓋訓練與推理全流程。
※ 摘要僅根據標題與說明
從零開始完整編寫 Stable Diffusion 模型,涵蓋數學原理、文字到影象生成、影象到影象及修復技術,並提供詳細的程式碼實作。
※ 摘要僅根據標題與說明
本影片由 Umar Jamil 完整演示如何從零開始用 Python 和 PyTorch 編寫一個自定義的多模態(視覺)語言模型。
※ 摘要僅根據標題與說明
從第一原理出發,手動推導並編寫 Flash Attention 核心演算法,涵蓋前向與後向傳播。同時從零講解 CUDA 與 Triton 程式設計,並深入探討 Autograd 系統、雅可比矩陣計算與 Softmax 操作,提供完整的 P…
※ 摘要僅根據標題與說明
以通俗方式解構 LLaMA 模型的核心技術,包括 KV-Cache、Rotary Positional Embedding、RMS Norm、Grouped Query Attention 與 SwiGLU,讓讀者快速掌握這些關鍵概念。
※ 摘要僅根據標題與說明
本影片詳述 RAG 管道,從語言模型基礎、向量計算至 Sentence BERT 與 HNSW 向量資料庫。讀者將掌握如何生成句子嵌入向量,並理解 HNSW 演算法如何高效搜尋向量。
※ 摘要僅根據標題與說明
深入解析人類反饋強化學習(RLHF),從語言模型運作原理與 AI 對齊概念開始,並從第一性原理推匯出政策梯度最佳化演算法。影片詳細說明如何降低估計方差、處理 Off-Policy 學習的挑戰,並展示如何建立獎勵模型與損失函式。
※ 摘要僅根據標題與說明
本影片詳細解構 BERT 模型,涵蓋訓練、推理、精調等核心概念,並深入探討其與 GPT/LLaMA 的差異。透過視覺化步驟,讓讀者掌握自注意力機制、[CLS] 標記及多工應用(如分類與問答)的實作原理。
※ 摘要僅根據標題與說明
依發布時間
從第一原理出發,使用 PyTorch 建構分散式訓練框架。影片涵蓋了分散式訓練的數學基礎、多頭注意力、旋轉位置嵌入及 YaRN 等輔助元件,並深入探討過程群、分散式梯度計算及現代語言模型的並行訓練技術。
※ 摘要僅根據標題與說明
從第一原理出發,手動推導並編寫 Flash Attention 核心演算法,涵蓋前向與後向傳播。同時從零講解 CUDA 與 Triton 程式設計,並深入探討 Autograd 系統、雅可比矩陣計算與 Softmax 操作,提供完整的 P…
※ 摘要僅根據標題與說明
本影片由 Umar Jamil 完整演示如何從零開始用 Python 和 PyTorch 編寫一個自定義的多模態(視覺)語言模型。
※ 摘要僅根據標題與說明
介紹機器學習可解釋性,透過深度學習與反向傳播原理,探討如何生成反範例與特徵視覺化。最後應用於語言模型,分析其偏誤,例如模型對女性或少數群體的看法。
※ 摘要僅根據標題與說明
介紹 Kolmogorov-Arnold Networks (KAN),一種新型神經網路架構。影片先回顧多層感知器與資料擬合概念,再深入探討貝茲曲線與 B-Splines 的數學基礎。
※ 摘要僅根據標題與說明
本影片解釋 Direct Preference Optimization (DPO),一種將語言模型轉化為隱性獎勵模型的技術。
※ 摘要僅根據標題與說明
深入解析人類反饋強化學習(RLHF),從語言模型運作原理與 AI 對齊概念開始,並從第一性原理推匯出政策梯度最佳化演算法。影片詳細說明如何降低估計方差、處理 Off-Policy 學習的挑戰,並展示如何建立獎勵模型與損失函式。
※ 摘要僅根據標題與說明
深入解析 Mamba 架構,涵蓋其核心數學原理、並行掃描機制、核融合技術以及與 Transformer 的比較。內容從基礎數學推導到 GPU 記憶體最佳化,提供讀者理解並應用此新型序列模型的方法。
※ 摘要僅根據標題與說明
深入解析 Mistral 系列模型的核心技術,包括滑動視窗注意力機制、稀疏混合專家架構以及 Rolling Buffer 等創新點。
※ 摘要僅根據標題與說明
本影片詳述如何使用 PyTorch 的 Distributed Data Parallel (DDP) 進行多卡或多伺服器訓練,涵蓋梯度累積、分散式通訊原語(如 Broadcast、Reduce、All-Reduce)及分散式訓練迴圈的整…
※ 摘要僅根據標題與說明
介紹了量化技術,從數值表示開始,深入探討非對稱與對稱量化、動態量化及訓練時量化等概念。
※ 摘要僅根據標題與說明
本影片詳述 RAG 管道,從語言模型基礎、向量計算至 Sentence BERT 與 HNSW 向量資料庫。讀者將掌握如何生成句子嵌入向量,並理解 HNSW 演算法如何高效搜尋向量。
※ 摘要僅根據標題與說明
本影片詳細解構 BERT 模型,涵蓋訓練、推理、精調等核心概念,並深入探討其與 GPT/LLaMA 的差異。透過視覺化步驟,讓讀者掌握自注意力機制、[CLS] 標記及多工應用(如分類與問答)的實作原理。
※ 摘要僅根據標題與說明
從零開始完整編寫 Stable Diffusion 模型,涵蓋數學原理、文字到影象生成、影象到影象及修復技術,並提供詳細的程式碼實作。
※ 摘要僅根據標題與說明
介紹如何從零開始用 PyTorch 編寫 LLaMA 2 模型,涵蓋 KV Cache、Grouped Query Attention 與 Rotary PE 等核心技術。
※ 摘要僅根據標題與說明
以通俗方式解構 LLaMA 模型的核心技術,包括 KV-Cache、Rotary Positional Embedding、RMS Norm、Grouped Query Attention 與 SwiGLU,讓讀者快速掌握這些關鍵概念。
※ 摘要僅根據標題與說明
本影片用程式碼演示 Segments Anything 模型如何從圖片中自動分割出不同物件,讓讀者了解其基本運作原理。
※ 摘要僅根據標題與說明
本影片用視覺化方式解釋 LoRA 技術,並提供從零開始的 PyTorch 程式碼實作,讓讀者理解低秩適應如何高效調整大型語言模型。
※ 摘要僅根據標題與說明
介紹 LongNet 如何將 Transformer 擴充套件至十億字元,並提供 Python 程式碼與解釋。
※ 摘要僅根據標題與說明
本影片用通俗語言解釋了 Diffusion Models 的基本運作原理,並提供程式碼範例讓讀者自行實踐。
※ 摘要僅根據標題與說明
影片用白話解釋了變分自編碼器(VAE)的運作原理、ELBO 損失函式及其數學公式,幫助讀者理解 AI 如何學習隱藏特徵。
※ 摘要僅根據標題與說明
本影片用繁體中文解釋了 Transformer 架構的核心原理,包括數學公式、推理與訓練過程,讓讀者理解為何 Attention 是關鍵。
※ 摘要僅根據標題與說明
本影片詳細介紹如何從零開始用 PyTorch 編寫 Transformer 模型,涵蓋訓練與推理全流程。
※ 摘要僅根據標題與說明
本介紹說明 CLIP 模型如何從資料中學習,並解釋其訓練與推理過程的基本原理。
※ 摘要僅根據標題與說明
本文章解釋 Wav2Lip 模型如何將人聲轉換為口型同步的動畫影片,並說明其運作原理。
※ 摘要僅根據標題與說明