跳到主要內容
AI 武林

DeepSeek R1

17 筆內容提到

最近 7 天 1 筆(再前 7 天 1 筆)

也寫作:DeepSeek-R1

這一頁列的是「提到 DeepSeek R1」的內容(名稱由語言模型從內容裡整理),不一定整筆都在講它。只想追它的新內容:訂閱 RSS;想找標題裡就有它的:搜尋「DeepSeek R1」。

最新

依發布時間

  1. PodcastThe TWIML AI Podcast進階EN

    The Evolution of Reasoning in Small Language Models with Yejin Choi - #761

    訪談斯坦福大學 Yejin Choi 教授,探討如何透過高品質、多樣化的資料與合成資料生成,讓小型語言模型具備更強的推理能力。內容涵蓋「稜鏡合成」等技術、避免模型輸出單一化,以及推動 AI 民主化與多元對齊的社會意義。

  2. 影片Hung-yi Lee進階中文

    【生成式AI時代下的機器學習(2025)】第八講:大型語言模型的推理過程不用太長、夠用就好

    探討大型語言模型推理過程過長是否必要,指出推理長度與正確率未必正相關,反而消耗額外算力。透過控制提示詞、調整參數、知識蒸餾及強化學習獎勵機制,可訓練出推理短且準確的模型,達到資源效率與效能的平衡。

    2.7 萬次觀看
  3. 影片Hung-yi Lee進階中文

    【生成式AI時代下的機器學習(2025)】第七講:DeepSeek-R1 這類大型語言模型是如何進行「深度思考」(Reasoning)的?

    李宏毅教授介紹大型語言模型如何透過深度思考(Reasoning)提升推理能力,涵蓋思維鏈、模仿學習與強化學習等方法。課程以 DeepSeek-R1 為例,說明模型如何模擬人類思考過程並進行自我驗證,同時探討測試時運算(Test Time…

  4. 影片Welch Labs進階EN

    How DeepSeek Rewrote the Transformer [MLA]

    深入解析 DeepSeek-V2 與 R1 如何重新設計 Transformer 架構,透過 KV Cache 壓縮與注意力機制最佳化提升效率。觀眾能理解這些技術如何減少計算資源並改善模型表現。

    99.4 萬次觀看

    ※ 摘要僅根據標題與說明

最受歡迎

依人氣

  1. 1影片Welch Labs進階EN

    How DeepSeek Rewrote the Transformer [MLA]

    深入解析 DeepSeek-V2 與 R1 如何重新設計 Transformer 架構,透過 KV Cache 壓縮與注意力機制最佳化提升效率。觀眾能理解這些技術如何減少計算資源並改善模型表現。

    99.4 萬次觀看

    ※ 摘要僅根據標題與說明

  2. 8影片Hung-yi Lee進階中文

    【生成式AI時代下的機器學習(2025)】第七講:DeepSeek-R1 這類大型語言模型是如何進行「深度思考」(Reasoning)的?

    李宏毅教授介紹大型語言模型如何透過深度思考(Reasoning)提升推理能力,涵蓋思維鏈、模仿學習與強化學習等方法。課程以 DeepSeek-R1 為例,說明模型如何模擬人類思考過程並進行自我驗證,同時探討測試時運算(Test Time…

  3. 9PodcastThe TWIML AI Podcast進階EN

    The Evolution of Reasoning in Small Language Models with Yejin Choi - #761

    訪談斯坦福大學 Yejin Choi 教授,探討如何透過高品質、多樣化的資料與合成資料生成,讓小型語言模型具備更強的推理能力。內容涵蓋「稜鏡合成」等技術、避免模型輸出單一化,以及推動 AI 民主化與多元對齊的社會意義。