跳到主要內容
AI 武林

Umar Jamil

YouTube ・ 國際 ・ 英文 ・ A 級 ・ 9.1 萬 訂閱 ・ 25 筆內容 ・ 最近更新 2026/08/18

從零實作 Transformer、LLM 論文細講

最受歡迎

依人氣

  1. 9影片進階EN

    Reinforcement Learning from Human Feedback explained with math derivations and the PyTorch code.(在新分頁開啟原站)

    深入解析人類反饋強化學習(RLHF),從語言模型運作原理與 AI 對齊概念開始,並從第一性原理推匯出政策梯度最佳化演算法。影片詳細說明如何降低估計方差、處理 Off-Policy 學習的挑戰,並展示如何建立獎勵模型與損失函式。

    7.7 萬次觀看

    ※ 摘要僅根據標題與說明

最新內容

依發布時間

  1. 影片進階EN

    Reinforcement Learning from Human Feedback explained with math derivations and the PyTorch code.(在新分頁開啟原站)

    深入解析人類反饋強化學習(RLHF),從語言模型運作原理與 AI 對齊概念開始,並從第一性原理推匯出政策梯度最佳化演算法。影片詳細說明如何降低估計方差、處理 Off-Policy 學習的挑戰,並展示如何建立獎勵模型與損失函式。

    7.7 萬次觀看

    ※ 摘要僅根據標題與說明