影片進階EN1.6 萬 次觀看
I trained (one of) the smallest Reasoning Language Models EVER from scratch
看影片(在新分頁開啟原站)連到 YouTube・Neural Breakdown with AVB
摘要
展示如何從零開始訓練極小的推理語言模型,透過強化學習讓模型在問答與知識圖譜任務中學習。觀眾可了解如何設計獎勵函式並使用 GRPO 等技術進行自訂訓練。
This video demonstrates training a tiny reasoning language model from scratch using reinforcement learning for question answering and knowledge graph tasks.
這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。
提到的工具與公司
- GRPO
適合誰看
適合有機器學習基礎、想嘗試從零訓練語言模型的開發者。
摘要依據
- 講者
- AVB
- 依據
- 標題與說明欄(還沒有取得字幕或內文)
為什麼排在這裡
- 人氣
- 0.47
- 新鮮
- 0.81
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Build A Reasoning Model From Scratch 6: Reinforcement Learning 1 (Implementing GRPO for RLVR)影片 ・ Sebastian Raschka
- Training Agents 3: Reinforcement Learning影片 ・ Hugging Face ・ 1 小時 17 分
- Build & Train a GLM-5.3-Flash Model From Scratch with Python影片 ・ freeCodeCamp.org ・ 44 分鐘
- Reinforcement Learning with Verifiable Rewards - Teaching LLMs to Solve Problems影片 ・ Adam Lucek
- GRPO++: Tricks for Making RL Actually Work文章 ・ Deep (Learning) Focus(Cameron R. Wolfe)
- Reinforcement Learning for LLMs: The Complete Guide文章 ・ Deep (Learning) Focus(Cameron R. Wolfe)
摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
