跳到主要內容
AI 武林

GRPO

16 筆內容提到

最近 7 天 3 筆↑2(比前一期多 2 筆)(再前 7 天 1 筆)

這一頁列的是「提到 GRPO」的內容(名稱由語言模型從內容裡整理),不一定整筆都在講它。只想追它的新內容:訂閱 RSS;想找標題裡就有它的:搜尋「GRPO」。

最新

依發布時間

  1. 影片Discover AI進階EN

    Recursive-in-Recursive AI for Scientific AI Agents

    介紹 ScienceBuddy 如何透過模型與工具協同進化,提升科學 AI 代理的準確率。內容說明將人類專家修正轉化為可執行任務,並透過 GWAS 與文獻推理實現自我改進。

    3,112次觀看

    ※ 摘要僅根據標題與說明

  2. 影片bycloud進階EN

    GLM-5.2: DeepSeek Was Wrong About RL?

    討論 GLM-5.2 模型訓練策略,指出其放棄 GRPO 改用 PPO 的決定值得關注,並分享作者對模型表現之外的洞見。適合對大模型訓練技術感興趣的開發者與研究者。

    3.6 萬次觀看

    ※ 摘要僅根據標題與說明

最受歡迎

依人氣

  1. 8影片bycloud進階EN

    GLM-5.2: DeepSeek Was Wrong About RL?

    討論 GLM-5.2 模型訓練策略,指出其放棄 GRPO 改用 PPO 的決定值得關注,並分享作者對模型表現之外的洞見。適合對大模型訓練技術感興趣的開發者與研究者。

    3.6 萬次觀看

    ※ 摘要僅根據標題與說明