Deep Dive into LLMs like ChatGPT(在新分頁開啟原站)
影片由前 OpenAI 與 Tesla 的 Andrej Karpathy 主持,深入探討大語言模型(LLM)的訓練架構與心理學思維,並展示如何將最新技術應用於實際工作。
※ 摘要僅根據標題與說明
24 筆內容・被提到 3 筆 ・ 171 萬 訂閱
vibe coding、agentic engineering 兩個詞的提出者
依人氣
影片由前 OpenAI 與 Tesla 的 Andrej Karpathy 主持,深入探討大語言模型(LLM)的訓練架構與心理學思維,並展示如何將最新技術應用於實際工作。
※ 摘要僅根據標題與說明
Andrej Karpathy 在影片中詳細拆解了如何從零開始手動編寫 GPT 模型。他解釋了如何將注意力機制與自回歸語言建模結合,並展示了利用 GitHub Copilot 輔助開發的過程。
※ 摘要僅根據標題與說明
影片由 Andrej Karpathy 分享他如何運用大型語言模型(LLM)解決實際問題。內容涵蓋從基礎互動到進階應用,包括使用 Python 編碼、處理檔案、進行資料分析、生成影象與影片,以及利用模型進行語音輸入輸出。
※ 摘要僅根據標題與說明
Andrej Karpathy 在 AI 安全峰會上分享了一場關於大型語言模型的 60 分鐘演講,探討其核心概念、與作業系統的類比,以及相關的安全挑戰。
※ 摘要僅根據標題與說明
這門課程詳細拆解了微分演演算法(微梯度)與神經網路訓練的核心原理。作者從基礎的導數概念開始,逐步演示如何構建微梯度框架,並透過手動演算例項,讓讀者掌握神經網路反向傳播的具體步驟與邏輯。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 親自演示如何從零開始重構 GPT-2 (124M) 模型。內容涵蓋了從建立基礎網路結構、最佳化訓練速度,到依照原始論文設定超引數並執行訓練的完整過程。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 親自演示如何從頭建立 GPT 系列所使用的 Tokenizer 模型。他深入探討了 Tokenizer 在大型語言模型中的核心地位,並指出許多模型異常行為皆源於此。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 介紹如何使用 PyTorch 的 Tensor 進行語言模型評估,涵蓋了基本二項詞符號級別語言模型的架構與訓練、樣本生成及損失評估(如負對數似然)等核心概念。
※ 摘要僅根據標題與說明
影片由 Andrej Karpathy 演示如何構建一個多層感知機(MLP)字級語言模型,並深入介紹機器學習基礎,包括模型訓練、超引數調整、評估指標及過擬合問題。
※ 摘要僅根據標題與說明
深入探討多層神經網路的啟用值與梯度統計特性,並分析不當歸一化可能帶來的風險。作者介紹 Batch Normalization 如何解決訓練深層網路的脆弱性問題,同時指出 Residual Connections 與 Adam 最佳化器仍是…
※ 摘要僅根據標題與說明
依發布時間
演講者探討 AI 從單純聊天工具演變為可程式設計的新層面,稱 2025 年底為代理工作的關鍵轉折點。他提出「軟體 3.0」概念,認為人類透過提示詞與上下文直接程式設計 LLM,而非傳統程式碼。
2025 年 LLM 領域出現多項重大正規化轉變,包括 RLVR 取代傳統訓練方式,使模型具備類似推理的解題策略;Ghost vs. Animals 理論指出 AI 智慧體呈現出「鬼魂」般的非連續性與多模態能力;
探討了大型語言模型(LLM)如何利用後見之明分析歷史資料的能力。作者使用 ChatGPT 5.1 Thinking 重現了 2015 年 Hacker News 的討論,並對其預測準確度進行評分。
安德烈·卡帕蒂指出,動物智慧與人工智慧(LLM)的最佳化壓力截然不同。動物為生存與繁衍而演化,具備強烈的本能驅力;而 LLM 則受商業演進影響,主要追求使用者點選與任務完成。文章強調理解這種差異對未來 AI 發展至關重要。
安德烈·卡帕蒂指出,AI 的下一個演進將是「可驗證性」,而非單純的自動化。當任務可驗證時,AI 便能透過強化學習直接最佳化,這將推動 LLM 在數學、程式碼等領域取得突破,但創造性與策略性任務仍受限制。
介紹了由 Andrej Karpathy 分享的「Vibe coding MenuGen」專案,這是一個利用 AI 自動將餐廳選單圖片轉化為視覺化選單的應用程式。
探討大語言模型如何顛覆技術普及模式,讓普通使用者獲得巨大便利,而企業與政府則受益有限。作者指出,LLM 雖具備廣泛但淺薄的能力,使個體能完成以前需要專家的任務,但企業因複雜度高、協同困難及組織慣性,難以快速吸收這些技術。
影片由 Andrej Karpathy 分享他如何運用大型語言模型(LLM)解決實際問題。內容涵蓋從基礎互動到進階應用,包括使用 Python 編碼、處理檔案、進行資料分析、生成影象與影片,以及利用模型進行語音輸入輸出。
※ 摘要僅根據標題與說明
影片由前 OpenAI 與 Tesla 的 Andrej Karpathy 主持,深入探討大語言模型(LLM)的訓練架構與心理學思維,並展示如何將最新技術應用於實際工作。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 親自演示如何從零開始重構 GPT-2 (124M) 模型。內容涵蓋了從建立基礎網路結構、最佳化訓練速度,到依照原始論文設定超引數並執行訓練的完整過程。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 親自演示如何從頭建立 GPT 系列所使用的 Tokenizer 模型。他深入探討了 Tokenizer 在大型語言模型中的核心地位,並指出許多模型異常行為皆源於此。
※ 摘要僅根據標題與說明
Andrej Karpathy 在 AI 安全峰會上分享了一場關於大型語言模型的 60 分鐘演講,探討其核心概念、與作業系統的類比,以及相關的安全挑戰。
※ 摘要僅根據標題與說明
Andrej Karpathy 在影片中詳細拆解了如何從零開始手動編寫 GPT 模型。他解釋了如何將注意力機制與自回歸語言建模結合,並展示了利用 GitHub Copilot 輔助開發的過程。
※ 摘要僅根據標題與說明
深入解析 WaveNet 架構,透過將二層 MLP 深化為樹狀結構,結合因果擴散層來實現高效神經網路。內容涵蓋 PyTorch 的層與容器概念、開發流程中的資料讀取與程式碼管理,並提供完整程式碼範例與教學筆記。
※ 摘要僅根據標題與說明
透過手動推導 2 層 MLP 的後向傳播,深入解析梯度如何在計算圖中流動,並透過高效 Tensor 概念建立對神經網路最佳化與演演算法的直觀理解。
※ 摘要僅根據標題與說明
深入探討多層神經網路的啟用值與梯度統計特性,並分析不當歸一化可能帶來的風險。作者介紹 Batch Normalization 如何解決訓練深層網路的脆弱性問題,同時指出 Residual Connections 與 Adam 最佳化器仍是…
※ 摘要僅根據標題與說明
影片由 Andrej Karpathy 演示如何構建一個多層感知機(MLP)字級語言模型,並深入介紹機器學習基礎,包括模型訓練、超引數調整、評估指標及過擬合問題。
※ 摘要僅根據標題與說明
本影片由 Andrej Karpathy 介紹如何使用 PyTorch 的 Tensor 進行語言模型評估,涵蓋了基本二項詞符號級別語言模型的架構與訓練、樣本生成及損失評估(如負對數似然)等核心概念。
※ 摘要僅根據標題與說明
影片展示 AI 如何透過插值隨機噪點來生成迷幻臉龐,並說明這需要 A100 晶片與數小時的運算。
※ 摘要僅根據標題與說明
影片展示 Stable Diffusion 如何透過 A100 晶片在睡夢中生成蒸汽朋克風格的腦部影象。作者利用隨機噪點與平滑插值技術,在 8 小時內完成渲染,展現了 AI 處理複雜視覺任務的潛力。
※ 摘要僅根據標題與說明
這門課程詳細拆解了微分演演算法(微梯度)與神經網路訓練的核心原理。作者從基礎的導數概念開始,逐步演示如何構建微梯度框架,並透過手動演算例項,讓讀者掌握神經網路反向傳播的具體步驟與邏輯。
※ 摘要僅根據標題與說明
Andrej Karpathy 在影片裡分享他如何將 Stable Diffusion 用於繪製藍莓義大利麵,並探討了模型在這種特定主題下的表現。
※ 摘要僅根據標題與說明
Andrej Karpathy 在影片裡探討了將蒸汽朋克風格的機械人與神經網路結合的構想,並展示了相關程式碼範例。
※ 摘要僅根據標題與說明
其他來源裡提到或訪談這位人物的內容
這則影片介紹了終於出現的 Karpathy LLM Wiki 開放標準,讓使用者能自由存取與使用。
※ 摘要僅根據標題與說明
Andrej Karpathy 在訪談中指出,AI 程式設計的未來不僅是寫出更快程式碼,更在於透過 Agentic Engineering 守住軟體品質與安全標準。
Andrej Karpathy 在 Dwarkesh Podcast 的訪談中,探討了 AGI 距離十年遠、強化學習的劣勢、人機學習差異以及教育未來。
※ 摘要僅根據標題與說明