看影片(在新分頁開啟原站)連到 YouTube・EZ.Encoder Academy
摘要
解析 DeepSeek-Math V2 如何透過自我驗證強化學習框架,在數學推理上超越 OpenAI 與 Google。觀眾可了解其獎勵模型設計、證明生成與驗證流程,以及該方法在實際資料集上的表現與侷限。
This video analyzes how DeepSeek-Math V2 uses self-verifiable reinforcement learning to surpass competitors in mathematical reasoning.
這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。
提到的工具與公司
- DeepSeek-Math V2
- DeepSeek-R1
- OpenAI
- GPT
- Gemini
適合誰看
對大型語言模型、數學推理或機器學習原理有興趣的開發者與研究者。
摘要依據
- 依據
- 標題與說明欄(還沒有取得字幕或內文)
為什麼排在這裡
- 人氣
- 0.13
- 新鮮
- 0.31
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- From DeepSeek V3 to V3.2: Architecture, Sparse Attention, and RL Updates文章 ・ Sebastian Raschka(部落格)
- Build A Reasoning Model From Scratch 3: The Verifier for Evaluation and RL with Verifiable Rewards影片 ・ Sebastian Raschka ・ 1 小時 27 分
- 【生成式AI時代下的機器學習(2025)】第七講:DeepSeek-R1 這類大型語言模型是如何進行「深度思考」(Reasoning)的?影片 ・ Hung-yi Lee ・ 1 小時 18 分
- GRPO - Group Relative Policy Optimization - How DeepSeek trains reasoning models影片 ・ Luis Serrano Academy ・ 22 分鐘
- DeepSeek V4: ten teachers, one student文章 ・ Maxime Labonne
- How a reasoning model cracked an 80-year-old math problem - Episode 20Podcast ・ OpenAI Podcast ・ 41 分鐘
摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
