Deep Dive into LLMs like ChatGPT(在新分頁開啟原站)
影片由前 OpenAI 與 Tesla 的 Andrej Karpathy 主持,深入探討大語言模型(LLM)的訓練架構與心理學思維,並展示如何將最新技術應用於實際工作。
※ 摘要僅根據標題與說明
YouTube ・ 國際 ・ 英文 ・ S 級 ・ 171 萬 訂閱 ・ 16 筆內容 ・ 最近更新 2025/02/28
Neural Networks: Zero to Hero、LLM 入門演講
依人氣
影片由前 OpenAI 與 Tesla 的 Andrej Karpathy 主持,深入探討大語言模型(LLM)的訓練架構與心理學思維,並展示如何將最新技術應用於實際工作。
※ 摘要僅根據標題與說明
Andrej Karpathy 在影片中詳細拆解了如何從零開始手動編寫 GPT 模型。他解釋了如何將注意力機制與自回歸語言建模結合,並展示了利用 GitHub Copilot 輔助開發的過程。
※ 摘要僅根據標題與說明
影片由 Andrej Karpathy 分享他如何運用大型語言模型(LLM)解決實際問題。內容涵蓋從基礎互動到進階應用,包括使用 Python 編碼、處理檔案、進行資料分析、生成影象與影片,以及利用模型進行語音輸入輸出。
※ 摘要僅根據標題與說明
Andrej Karpathy 在 AI 安全峰會上分享了一場關於大型語言模型的 60 分鐘演講,探討其核心概念、與作業系統的類比,以及相關的安全挑戰。
※ 摘要僅根據標題與說明
這門課程詳細拆解了微分演演算法(微梯度)與神經網路訓練的核心原理。作者從基礎的導數概念開始,逐步演示如何構建微梯度框架,並透過手動演算例項,讓讀者掌握神經網路反向傳播的具體步驟與邏輯。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 親自演示如何從零開始重構 GPT-2 (124M) 模型。內容涵蓋了從建立基礎網路結構、最佳化訓練速度,到依照原始論文設定超引數並執行訓練的完整過程。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 親自演示如何從頭建立 GPT 系列所使用的 Tokenizer 模型。他深入探討了 Tokenizer 在大型語言模型中的核心地位,並指出許多模型異常行為皆源於此。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 介紹如何使用 PyTorch 的 Tensor 進行語言模型評估,涵蓋了基本二項詞符號級別語言模型的架構與訓練、樣本生成及損失評估(如負對數似然)等核心概念。
※ 摘要僅根據標題與說明
影片由 Andrej Karpathy 演示如何構建一個多層感知機(MLP)字級語言模型,並深入介紹機器學習基礎,包括模型訓練、超引數調整、評估指標及過擬合問題。
※ 摘要僅根據標題與說明
深入探討多層神經網路的啟用值與梯度統計特性,並分析不當歸一化可能帶來的風險。作者介紹 Batch Normalization 如何解決訓練深層網路的脆弱性問題,同時指出 Residual Connections 與 Adam 最佳化器仍是…
※ 摘要僅根據標題與說明
依發布時間
影片由 Andrej Karpathy 分享他如何運用大型語言模型(LLM)解決實際問題。內容涵蓋從基礎互動到進階應用,包括使用 Python 編碼、處理檔案、進行資料分析、生成影象與影片,以及利用模型進行語音輸入輸出。
※ 摘要僅根據標題與說明
影片由前 OpenAI 與 Tesla 的 Andrej Karpathy 主持,深入探討大語言模型(LLM)的訓練架構與心理學思維,並展示如何將最新技術應用於實際工作。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 親自演示如何從零開始重構 GPT-2 (124M) 模型。內容涵蓋了從建立基礎網路結構、最佳化訓練速度,到依照原始論文設定超引數並執行訓練的完整過程。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 親自演示如何從頭建立 GPT 系列所使用的 Tokenizer 模型。他深入探討了 Tokenizer 在大型語言模型中的核心地位,並指出許多模型異常行為皆源於此。
※ 摘要僅根據標題與說明
Andrej Karpathy 在 AI 安全峰會上分享了一場關於大型語言模型的 60 分鐘演講,探討其核心概念、與作業系統的類比,以及相關的安全挑戰。
※ 摘要僅根據標題與說明
Andrej Karpathy 在影片中詳細拆解了如何從零開始手動編寫 GPT 模型。他解釋了如何將注意力機制與自回歸語言建模結合,並展示了利用 GitHub Copilot 輔助開發的過程。
※ 摘要僅根據標題與說明
深入解析 WaveNet 架構,透過將二層 MLP 深化為樹狀結構,結合因果擴散層來實現高效神經網路。內容涵蓋 PyTorch 的層與容器概念、開發流程中的資料讀取與程式碼管理,並提供完整程式碼範例與教學筆記。
※ 摘要僅根據標題與說明
透過手動推導 2 層 MLP 的後向傳播,深入解析梯度如何在計算圖中流動,並透過高效 Tensor 概念建立對神經網路最佳化與演演算法的直觀理解。
※ 摘要僅根據標題與說明
深入探討多層神經網路的啟用值與梯度統計特性,並分析不當歸一化可能帶來的風險。作者介紹 Batch Normalization 如何解決訓練深層網路的脆弱性問題,同時指出 Residual Connections 與 Adam 最佳化器仍是…
※ 摘要僅根據標題與說明
影片由 Andrej Karpathy 演示如何構建一個多層感知機(MLP)字級語言模型,並深入介紹機器學習基礎,包括模型訓練、超引數調整、評估指標及過擬合問題。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 介紹如何使用 PyTorch 的 Tensor 進行語言模型評估,涵蓋了基本二項詞符號級別語言模型的架構與訓練、樣本生成及損失評估(如負對數似然)等核心概念。
※ 摘要僅根據標題與說明
影片展示 AI 如何透過插值隨機噪點來生成迷幻臉龐,並說明這需要 A100 晶片與數小時的運算。
※ 摘要僅根據標題與說明
影片展示 Stable Diffusion 如何透過 A100 晶片在睡夢中生成蒸汽朋克風格的腦部影象。作者利用隨機噪點與平滑插值技術,在 8 小時內完成渲染,展現了 AI 處理複雜視覺任務的潛力。
※ 摘要僅根據標題與說明
這門課程詳細拆解了微分演演算法(微梯度)與神經網路訓練的核心原理。作者從基礎的導數概念開始,逐步演示如何構建微梯度框架,並透過手動演算例項,讓讀者掌握神經網路反向傳播的具體步驟與邏輯。
※ 摘要僅根據標題與說明
Andrej Karpathy 在影片裡分享他如何將 Stable Diffusion 用於繪製藍莓義大利麵,並探討了模型在這種特定主題下的表現。
※ 摘要僅根據標題與說明
Andrej Karpathy 在影片裡探討了將蒸汽朋克風格的機械人與神經網路結合的構想,並展示了相關程式碼範例。
※ 摘要僅根據標題與說明