跳到主要內容
AI 武林
影片進階EN6.6 萬 次觀看

Stanford CS329A Self-Improving AI Agents | Part 2 | Test-Time Compute Scaling

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

探討如何在推理階段透過增加計算量來提升大型語言模型效能,涵蓋並行取樣、驗證機制及架構搜尋等技術。觀眾可學習如何利用測試時計算超越現有模型,並掌握相關Scaling Law與實務架構設計。

This lecture explores test-time compute scaling techniques to enhance LLM performance without retraining, covering parallel sampling, reward models, and architecture search.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 透過並行取樣與驗證,可讓小模型在特定任務上超越大模型。
  • 利用過程獎勵模型與結果獎勵模型引導搜尋與架構最佳化。
  • Arkon架構透過多層推理技術堆疊,顯著提升任務解決率。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:05推論階段如何提升模型效能
  2. 04:49推論階段的指數律與覆蓋率
  3. 08:07長尾難題是指數律成立關鍵
  4. 11:30從一次推論轉向多次運算
  5. 16:20驗證機制與生成驗證差距
  6. 19:24驗證器品質對準確率影響
  7. 23:10未來擴展方向與驗證器挑戰
  8. 28:47結果導向與過程導向獎勵模型
  9. 38:02測試時運算與預訓練規模化比較
  10. 42:56串列與樹狀搜尋策略之混合
  11. 46:03Archon 架構最佳化框架介紹
  12. 49:06Archon 架構中融合與評審機制
  13. 55:27利用單元測試驗證程式碼架構
  14. 1:02:42超越 GPT-4 與 Claude 3.5 表現

提到的工具與公司

  • Llama 3
  • GPT-4o
  • Claude 3.5
  • DeepSeek-V3
  • Palm
  • Arkon
  • CUDA

適合誰看

適合正在研究或實踐大語言模型推理最佳化、希望提升模型效能的開發者與研究者。

摘要依據

講者
Test-Time Compute Scaling
依據
人工字幕

為什麼排在這裡

人氣
0.79
新鮮
0.79

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)