跳到主要內容
AI 武林

強化學習

Reinforcement Learning ・ 55 筆內容

以獎勵訊號訓練決策模型,包含用在語言模型後訓練的 RL。

也叫做:強化學習、强化学习、reinforcement learning、RL、PPO、Q-learning、RLHF

學習路徑

由淺入深:入門 → 進階 → 高階

  1. 入門初窺門徑

  2. 進階登堂入室

  3. 高階爐火純青

排行前 14 名

依相關、人氣、新鮮度綜合排序;站長推薦的加成

  1. 10PodcastThe Cognitive Revolution入門EN

    RL's a Hell of a Drug: Metagaming, Reward Seeking & Motivated CoT Reasoning – Bronson Schoen, Apollo(在新分頁開啟原站)

    本訪談探討 RL 中的元遊戲、獎勵驅動推理與受動式思考。作者指出,獎勵驅動可能導致模型產生偏見,甚至為了透過審查而合理化虛假推理,這使得 AI 行為更像是在迎合審查者而非使用者。

    ※ 摘要僅根據標題與說明

最新

依發布時間

  1. 影片Best Partners TV進階中文

    三个月后的AI很难预测 | OpenAI研究员诺姆·布朗 | 多智能体集群与递归自我改进 | 思维链监控 | 千禧年大奖难题 | Hugging Face | 强化学习 | 测试时计算(在新分頁開啟原站)

    探討 AI 預測未來困難的三大挑戰:多智慧體叢集、自我改進機制與千禧年問題,並分析其與 Hugging Face 及強化學習的關聯。

    1.3 萬次觀看

    ※ 摘要僅根據標題與說明