跳到主要內容
AI 武林

Jia-Bin Huang

YouTube ・ 國際 ・ 英文 ・ A 級 ・ 4.9 萬 訂閱 ・ 15 筆內容 ・ 最近更新 2026/10/09

用動畫講新論文的機制:speculative decoding、MoE 怎麼訓練、模型怎麼改自己的記憶;一兩週一支

最受歡迎

依人氣

  1. 4影片進階EN

    Two API Calls Exposed AI's Hidden Reasoning

    解析論文,說明僅透過兩次 API 呼叫即可從加密的鏈式思考區塊中重現並解碼強權 AI 模型的隱藏推理過程。觀眾能了解加密推理的移植性風險及相關防護措施。

    3.1 萬次觀看

    ※ 摘要僅根據標題與說明

  2. 5影片進階EN

    How AI Learned to Teach Itself [JEPA]

    追溯 30 多年無標籤自監督學習演進,從隨機點立體圖到 JEPA 架構,解釋如何預測潛在空間並規劃行動。觀眾可了解現代世界模型的關鍵觀念與原理。

    5.6 萬次觀看

    ※ 摘要僅根據標題與說明

  3. 7影片進階EN

    The Tiny Idea That Lets Anyone Fine-Tune AI

    介紹 LoRA 如何透過低秩更新讓大模型無需調整所有權重即可進行微調,並涵蓋 LoRA+、QLoRA、VeRA 與 DoRA 等變體。看完能理解參數高效微調的原理與實際應用方式。

    3.7 萬次觀看

    ※ 摘要僅根據標題與說明

  4. 8影片進階EN

    Why AI Spent 60 Years Hunting for the Right Activation

    介紹現代 AI 模型依賴的激活函數演進歷程,從 Sigmoid 到 ReLU 及 GLU 系列。看完能理解不同函式的優缺點與解決的梯度問題。

    3.3 萬次觀看

    ※ 摘要僅根據標題與說明

  5. 9影片進階EN

    How Kimi Trains 896 Experts Without Collapse

    解析 Kimi K3 如何透過 Stable LatentMoE 架構,在 2.8 兆參數下僅用 1040 億活躍參數訓練,並解決大規模 MoE 訓練不穩定的問題。

    1.2 萬次觀看

    ※ 摘要僅根據標題與說明

  6. 10影片進階EN

    How Small Models Learn to Think Like Giants | On-Policy Distillation

    從第一原理解釋知識蒸餾,介紹 On-Policy Distillation 讓學生模型在獲得教師指導的同時,利用自身軌跡進行學習。觀眾能理解如何訓練小型但強大的 AI 模型,並掌握相關技術應用。

    1.5 萬次觀看

    ※ 摘要僅根據標題與說明

最新內容

依發布時間

  1. 影片進階EN

    Why AI Doesn't Actually Read Words

    探討語言模型如何理解文字,從傳統的詞元編碼演進至以原始位元組為基礎的模型,如 ByT5、CANINE 等。觀眾能了解模型如何從資料中學習適應性單元,以及未來分詞技術的潛在方向。

    303次觀看

    ※ 摘要僅根據標題與說明

  2. 影片進階EN

    What If an AI Could Edit Its Own Memory?

    探討 AI 代理如何將上下文視作可編輯的檔案而非固定歷史,並介紹 Context Language Models 技術。觀眾能了解解決長程任務記憶牆的方法與潛在風險。

    1.5 萬次觀看

    ※ 摘要僅根據標題與說明

  3. 影片進階EN

    Two API Calls Exposed AI's Hidden Reasoning

    解析論文,說明僅透過兩次 API 呼叫即可從加密的鏈式思考區塊中重現並解碼強權 AI 模型的隱藏推理過程。觀眾能了解加密推理的移植性風險及相關防護措施。

    3.1 萬次觀看

    ※ 摘要僅根據標題與說明

  4. 影片進階EN

    How Kimi Trains 896 Experts Without Collapse

    解析 Kimi K3 如何透過 Stable LatentMoE 架構,在 2.8 兆參數下僅用 1040 億活躍參數訓練,並解決大規模 MoE 訓練不穩定的問題。

    1.2 萬次觀看

    ※ 摘要僅根據標題與說明

  5. 影片進階EN

    How Small Models Learn to Think Like Giants | On-Policy Distillation

    從第一原理解釋知識蒸餾,介紹 On-Policy Distillation 讓學生模型在獲得教師指導的同時,利用自身軌跡進行學習。觀眾能理解如何訓練小型但強大的 AI 模型,並掌握相關技術應用。

    1.5 萬次觀看

    ※ 摘要僅根據標題與說明

  6. 影片進階EN

    The Tiny Idea That Lets Anyone Fine-Tune AI

    介紹 LoRA 如何透過低秩更新讓大模型無需調整所有權重即可進行微調,並涵蓋 LoRA+、QLoRA、VeRA 與 DoRA 等變體。看完能理解參數高效微調的原理與實際應用方式。

    3.7 萬次觀看

    ※ 摘要僅根據標題與說明

  7. 影片進階EN

    How AI Learned to Teach Itself [JEPA]

    追溯 30 多年無標籤自監督學習演進,從隨機點立體圖到 JEPA 架構,解釋如何預測潛在空間並規劃行動。觀眾可了解現代世界模型的關鍵觀念與原理。

    5.6 萬次觀看

    ※ 摘要僅根據標題與說明

  8. 影片進階EN

    Why AI Spent 60 Years Hunting for the Right Activation

    介紹現代 AI 模型依賴的激活函數演進歷程,從 Sigmoid 到 ReLU 及 GLU 系列。看完能理解不同函式的優缺點與解決的梯度問題。

    3.3 萬次觀看

    ※ 摘要僅根據標題與說明

  9. 影片進階EN

    The Most Underrated Layer Inside Every AI Model

    由 Jia-Bin Huang 解說每個 AI 模型內隱藏的歸一化層原理與作用,並介紹動態 Tanh (DyT) 等替代方案。觀眾能理解為何訓練會不穩定以及簡單替代方法的效果。

    2.7 萬次觀看

    ※ 摘要僅根據標題與說明

  10. 影片進階EN

    We’ve Been Doing Attention Wrong (2-Line Fix)

    介紹 Exclusive Self Attention (XSA),僅需兩行程式碼即可最佳化標準注意力機制,提升效能且無需大幅增加計算與記憶體成本。觀眾可學習如何以極簡方式修正注意力機制的偏誤。

    3.1 萬次觀看

    ※ 摘要僅根據標題與說明

  11. 影片進階EN

    Transformers Attend Over Tokens. Why Not Over Layers?

    介紹 Attention Residuals 架構,用深度向 softmax 注意力機製取代固定殘差累加,讓各層能根據輸入選擇性結合早期表示。此方法提升訓練與推論效率,適合想最佳化 Transformer 結構的開發者。

    2.5 萬次觀看

    ※ 摘要僅根據標題與說明