聽節目(在新分頁開啟原站)連到 OnBoard!
摘要
深入解析 DeepSeek R1 的技術核心,包括其強化學習(RL)策略、長鏈式思考(Long CoT)機制以及資料驅動的設計。節目探討了這些技術如何降低訓練與推理成本,並引發對模型泛化能力(如從數學推論轉化為文學創作)的討論。此外,還分析了 R1 對開源生態可能帶來的影響,並結合 TinyZero 等實作案例,展現了該模型在複雜任務中的潛力與挑戰。
This podcast delves into the technical core of DeepSeek R1, covering its reinforcement learning strategies, long chain-of-thought mechanisms, and data-driven design. It explores how these technologies reduce training and inference costs while sparking discussions on model generalization, such as the…
重點
- DeepSeek R1 結合 RL 與 Long CoT 技術,大幅降低推理成本並提升複雜任務能力。
- 模型在數學與程式碼上的精進,引發對其文學創作泛化能力的討論。
- R1 的開源特性與 TinyZero 實作,為開源生態帶來新變革。
章節
依話題轉折切分,標題由 AI 產生
- 00:00DeepSeek R1 的技術突破與成本優勢
- 10:26從 Google 到 DeepSeek:AI 技術的跨越式發展
- 40:21RLHF 的未來方向與資料生成策略
- 1:00:57RL 訓練的高昂成本與 Scalability 挑戰
- 1:07:55Infra 架構的差異化與最佳實踐
- 1:12:28MLA 技術如何降低推理成本
- 1:16:30MoE 架構的規模差異與核心區別
- 1:32:12V3 架構與 RL 訓練的最佳化策略
- 1:44:19O1 中文回應的意外發現與資料清洗
- 1:49:48模型間蒸餾的理論限制與實際應用
- 1:53:49市場接受度與使用者習慣的長期影響
- 2:19:18AGI 時代下的個人生命意義反思
- 2:41:21AI 超越人類後的社會價值重構
提到的工具與公司
- DeepSeek R1
- Long CoT
- RLHF
- TinyZero
- SGLang
- Hugging Face
- OpenAI o1
適合誰看
對 AI 技術趨勢感興趣、關注開源大模型發展及強化學習原理的讀者。
摘要依據
- 講者
- Monica Xie
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.11
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- 【生成式AI時代下的機器學習(2025)】第七講:DeepSeek-R1 這類大型語言模型是如何進行「深度思考」(Reasoning)的?影片 ・ Hung-yi Lee ・ 1 小時 18 分(在新分頁開啟原站)
- EP165 | 科技工作講新年特別節目 + DeepSeek R1來襲影片 ・ 科技工作講 Tech Job N Talk ・ 1 小時 33 分(在新分頁開啟原站)
- DeepSeek R1 真的那么强吗?客观评测 R1 与 o1 在编程、推理方面的效果影片 ・ 马克的技术工作坊 ・ 22 分鐘(在新分頁開啟原站)
- EP 62. Google Deepmind 与LLM研究员深度解读OpenAI o1 及LLM+强化学习新范式Podcast ・ OnBoard! ・ 2 小時 43 分(在新分頁開啟原站)
- From DeepSeek V3 to V3.2: Architecture, Sparse Attention, and RL Updates文章 ・ Sebastian Raschka(部落格)
- GLM-5.2: DeepSeek Was Wrong About RL?影片 ・ bycloud ・ 16 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
