DeepSeek Splits the Transformer in Two. Here’s Why.
DeepSeek-V4.1-Flash 將每 token 的全域性 KV cache 壓縮至 890 bytes,比 V4-Flash 小 3.9 倍且總持久 cache 縮小約八倍。
※ 摘要僅根據標題與說明
依人氣
DeepSeek-V4.1-Flash 將每 token 的全域性 KV cache 壓縮至 890 bytes,比 V4-Flash 小 3.9 倍且總持久 cache 縮小約八倍。
※ 摘要僅根據標題與說明
介紹 DeepSeek V4 模型如何透過壓縮注意力機制(CSA 與 HCA)大幅降低記憶體佔用。觀眾能了解長上下文處理的高效架構與關鍵技術細節。
※ 摘要僅根據標題與說明
介紹 Speculative Decoding 如何透過快速草稿模型預測並由大模型驗證,在不改變輸出分佈的前提下加速 LLM 推理。
※ 摘要僅根據標題與說明
解析論文,說明僅透過兩次 API 呼叫即可從加密的鏈式思考區塊中重現並解碼強權 AI 模型的隱藏推理過程。觀眾能了解加密推理的移植性風險及相關防護措施。
※ 摘要僅根據標題與說明
追溯 30 多年無標籤自監督學習演進,從隨機點立體圖到 JEPA 架構,解釋如何預測潛在空間並規劃行動。觀眾可了解現代世界模型的關鍵觀念與原理。
※ 摘要僅根據標題與說明
介紹 DeepSeek 的 Engram 技術,透過可擴展的查詢機制讓大型語言模型直接檢索知識,無需重建事實。這能釋放注意力與 MoE 層,提升推理能力並最佳化模型架構。
※ 摘要僅根據標題與說明
介紹 LoRA 如何透過低秩更新讓大模型無需調整所有權重即可進行微調,並涵蓋 LoRA+、QLoRA、VeRA 與 DoRA 等變體。看完能理解參數高效微調的原理與實際應用方式。
※ 摘要僅根據標題與說明
介紹現代 AI 模型依賴的激活函數演進歷程,從 Sigmoid 到 ReLU 及 GLU 系列。看完能理解不同函式的優缺點與解決的梯度問題。
※ 摘要僅根據標題與說明
解析 Kimi K3 如何透過 Stable LatentMoE 架構,在 2.8 兆參數下僅用 1040 億活躍參數訓練,並解決大規模 MoE 訓練不穩定的問題。
※ 摘要僅根據標題與說明
從第一原理解釋知識蒸餾,介紹 On-Policy Distillation 讓學生模型在獲得教師指導的同時,利用自身軌跡進行學習。觀眾能理解如何訓練小型但強大的 AI 模型,並掌握相關技術應用。
※ 摘要僅根據標題與說明
依發布時間
探討語言模型如何理解文字,從傳統的詞元編碼演進至以原始位元組為基礎的模型,如 ByT5、CANINE 等。觀眾能了解模型如何從資料中學習適應性單元,以及未來分詞技術的潛在方向。
※ 摘要僅根據標題與說明
探討 AI 代理如何將上下文視作可編輯的檔案而非固定歷史,並介紹 Context Language Models 技術。觀眾能了解解決長程任務記憶牆的方法與潛在風險。
※ 摘要僅根據標題與說明
DeepSeek-V4.1-Flash 將每 token 的全域性 KV cache 壓縮至 890 bytes,比 V4-Flash 小 3.9 倍且總持久 cache 縮小約八倍。
※ 摘要僅根據標題與說明
介紹 Speculative Decoding 如何透過快速草稿模型預測並由大模型驗證,在不改變輸出分佈的前提下加速 LLM 推理。
※ 摘要僅根據標題與說明
解析論文,說明僅透過兩次 API 呼叫即可從加密的鏈式思考區塊中重現並解碼強權 AI 模型的隱藏推理過程。觀眾能了解加密推理的移植性風險及相關防護措施。
※ 摘要僅根據標題與說明
解析 Kimi K3 如何透過 Stable LatentMoE 架構,在 2.8 兆參數下僅用 1040 億活躍參數訓練,並解決大規模 MoE 訓練不穩定的問題。
※ 摘要僅根據標題與說明
從第一原理解釋知識蒸餾,介紹 On-Policy Distillation 讓學生模型在獲得教師指導的同時,利用自身軌跡進行學習。觀眾能理解如何訓練小型但強大的 AI 模型,並掌握相關技術應用。
※ 摘要僅根據標題與說明
介紹 LoRA 如何透過低秩更新讓大模型無需調整所有權重即可進行微調,並涵蓋 LoRA+、QLoRA、VeRA 與 DoRA 等變體。看完能理解參數高效微調的原理與實際應用方式。
※ 摘要僅根據標題與說明
追溯 30 多年無標籤自監督學習演進,從隨機點立體圖到 JEPA 架構,解釋如何預測潛在空間並規劃行動。觀眾可了解現代世界模型的關鍵觀念與原理。
※ 摘要僅根據標題與說明
介紹現代 AI 模型依賴的激活函數演進歷程,從 Sigmoid 到 ReLU 及 GLU 系列。看完能理解不同函式的優缺點與解決的梯度問題。
※ 摘要僅根據標題與說明
由 Jia-Bin Huang 解說每個 AI 模型內隱藏的歸一化層原理與作用,並介紹動態 Tanh (DyT) 等替代方案。觀眾能理解為何訓練會不穩定以及簡單替代方法的效果。
※ 摘要僅根據標題與說明
介紹 DeepSeek V4 模型如何透過壓縮注意力機制(CSA 與 HCA)大幅降低記憶體佔用。觀眾能了解長上下文處理的高效架構與關鍵技術細節。
※ 摘要僅根據標題與說明
介紹 Exclusive Self Attention (XSA),僅需兩行程式碼即可最佳化標準注意力機制,提升效能且無需大幅增加計算與記憶體成本。觀眾可學習如何以極簡方式修正注意力機制的偏誤。
※ 摘要僅根據標題與說明
介紹 DeepSeek 的 Engram 技術,透過可擴展的查詢機制讓大型語言模型直接檢索知識,無需重建事實。這能釋放注意力與 MoE 層,提升推理能力並最佳化模型架構。
※ 摘要僅根據標題與說明
介紹 Attention Residuals 架構,用深度向 softmax 注意力機製取代固定殘差累加,讓各層能根據輸入選擇性結合早期表示。此方法提升訓練與推論效率,適合想最佳化 Transformer 結構的開發者。
※ 摘要僅根據標題與說明