看影片(在新分頁開啟原站)連到 YouTube・Graham Neubig
摘要
由 Graham Neubig 講授,介紹推理模型的概念、訓練方法與演算法。觀眾可了解 STaR、DeepSeek R1 等技術與長鏈式思考的應用。
This lecture covers reasoning models, their training via reinforcement learning, and advanced algorithms like STaR and DeepSeek R1.
這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。
提到的工具與公司
- STaR
- DeepSeek R1
- GRPO
- S1
- L1
- LAPS
適合誰看
學習自然語言處理或機器學習的學生與研究者。
摘要依據
- 講者
- Graham Neubig
- 依據
- 標題與說明欄(還沒有取得字幕或內文)
為什麼排在這裡
- 人氣
- 0.13
- 新鮮
- 0.26
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- CMU LLM Inference (7): Chain of Thought and Intermediate Steps影片 ・ Graham Neubig
- 【生成式AI時代下的機器學習(2025)】第七講:DeepSeek-R1 這類大型語言模型是如何進行「深度思考」(Reasoning)的?影片 ・ Hung-yi Lee ・ 1 小時 18 分
- CMU LLM Inference (12): Reward Models and Best-of-N影片 ・ Graham Neubig
- The State Of LLMs 2025: Progress, Problems, and Predictions文章 ・ Sebastian Raschka(部落格)
- GRPO - Group Relative Policy Optimization - How DeepSeek trains reasoning models影片 ・ Luis Serrano Academy ・ 22 分鐘
- Build A Reasoning Model From Scratch 6: Reinforcement Learning 1 (Implementing GRPO for RLVR)影片 ・ Sebastian Raschka
摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
