跳到主要內容
AI 武林
影片進階EN7,289 次觀看

CMU LLM Inference (12): Reward Models and Best-of-N

來源 Graham Neubig人物 Graham Neubig

看影片(在新分頁開啟原站)連到 YouTube・Graham Neubig

摘要

由 Amanda Bertsch 講授,涵蓋獎勵模型、Best-of-N 理論與實作,以及蒙特卡洛樹搜尋。觀眾可學習大型語言模型推理中獎勵模型設計與最佳策略選擇的具體方法。

This lecture covers reward models, best-of-n strategies, and Monte Carlo Tree Search for LLM inference.

這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。

適合誰看

正在學習大型語言模型推理或自然語言處理的學生與研究者。

摘要依據

講者
Graham Neubig
依據
標題與說明欄(還沒有取得字幕或內文)

為什麼排在這裡

人氣
0.21
新鮮
0.26

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)