跳到主要內容
AI 武林

Yannic Kilcher

YouTube ・ 國際 ・ 英文 ・ A 級 ・ 33.2 萬 訂閱 ・ 29 筆內容 ・ 最近更新 2026/03/07

最受歡迎

依人氣

  1. 6影片高階EN

    [Paper Analysis] On the Theoretical Limitations of Embedding-Based Retrieval (Warning: Rant)(在新分頁開啟原站)

    探討向量嵌入在檢索任務中的理論限制,指出即使查詢極其簡單,模型仍可能無法返回所有相關結果。作者結合學習理論,證明嵌入維度限制了能返回的頂部 k 個結果數量,並透過 LIMIT 資料集驗證,即使最優模型也無法解決此問題。

    3.7 萬次觀看

    ※ 摘要僅根據標題與說明

  2. 7影片高階EN

    TiDAR: Think in Diffusion, Talk in Autoregression (Paper Analysis)(在新分頁開啟原站)

    TiDAR 是一種結合擴散與自回歸架構的序列級混合模型,能在單次前向傳播中同時進行擴散推理與自回歸樣本驗證。該模型透過精心設計的結構化注意力掩碼,利用 GPU 的計算密度平衡了生成效率與品質,並支援 KV 快取,在 1.5B 至 8B 規…

    2.4 萬次觀看

    ※ 摘要僅根據標題與說明

  3. 8影片高階EN

    Titans: Learning to Memorize at Test Time (Paper Analysis)(在新分頁開啟原站)

    分析了一篇關於「泰坦」架構的論文,該架構結合了注意力機制與新的長期記憶模組,以解決傳統模型在長上下文處理上的限制。實驗結果顯示,Titan 在語言建模、常識推理及基因組學等任務中表現優於傳統 Transformer 模型,並能更有效地處理…

    2.5 萬次觀看

    ※ 摘要僅根據標題與說明

最新內容

依發布時間

  1. 影片高階EN

    TiDAR: Think in Diffusion, Talk in Autoregression (Paper Analysis)(在新分頁開啟原站)

    TiDAR 是一種結合擴散與自回歸架構的序列級混合模型,能在單次前向傳播中同時進行擴散推理與自回歸樣本驗證。該模型透過精心設計的結構化注意力掩碼,利用 GPU 的計算密度平衡了生成效率與品質,並支援 KV 快取,在 1.5B 至 8B 規…

    2.4 萬次觀看

    ※ 摘要僅根據標題與說明

  2. 影片高階EN

    Titans: Learning to Memorize at Test Time (Paper Analysis)(在新分頁開啟原站)

    分析了一篇關於「泰坦」架構的論文,該架構結合了注意力機制與新的長期記憶模組,以解決傳統模型在長上下文處理上的限制。實驗結果顯示,Titan 在語言建模、常識推理及基因組學等任務中表現優於傳統 Transformer 模型,並能更有效地處理…

    2.5 萬次觀看

    ※ 摘要僅根據標題與說明

  3. 影片進階EN

    [Paper Analysis] The Free Transformer (and some Variational Autoencoder stuff)(在新分頁開啟原站)

    這篇論文介紹了基於變分自編碼器(VAE)的無監督學習方法,用於擴充套件 Transformer 的解碼器。作者提出一種機制,讓生成過程能依賴隨機隱變數,無需監督資料即可訓練,並證實此方法能顯著提升下游任務表現。

    2.4 萬次觀看

    ※ 摘要僅根據標題與說明

  4. 影片高階EN

    [Paper Analysis] On the Theoretical Limitations of Embedding-Based Retrieval (Warning: Rant)(在新分頁開啟原站)

    探討向量嵌入在檢索任務中的理論限制,指出即使查詢極其簡單,模型仍可能無法返回所有相關結果。作者結合學習理論,證明嵌入維度限制了能返回的頂部 k 個結果數量,並透過 LIMIT 資料集驗證,即使最優模型也無法解決此問題。

    3.7 萬次觀看

    ※ 摘要僅根據標題與說明

  5. 影片進階EN

    Context Rot: How Increasing Input Tokens Impacts LLM Performance (Paper Analysis)(在新分頁開啟原站)

    本研究指出,大語言模型(LLM)的表現並非均勻處理所有上下文,隨著輸入字數增加,其可靠性會顯著下降。作者評估了包括 GPT-4.1 與 Claude 4 在內的 18 個模型,發現模型對長文字的處理能力遠不如短文字,這挑戰了傳統假設。

    3.4 萬次觀看

    ※ 摘要僅根據標題與說明

  6. 影片進階EN

    Energy-Based Transformers are Scalable Learners and Thinkers (Paper Review)(在新分頁開啟原站)

    探討能量基礎轉譯器(EBTs)能否像人類 System 2 思考一樣,僅憑無監督學習即可思考。作者提出一種新方法,透過驗證輸入與預測的相容性來最佳化,成功讓 EBTs 在文字與視覺模態下均能比 Transformer++ 更快、更有效地訓…

    3.3 萬次觀看

    ※ 摘要僅根據標題與說明