影片高階EN1.8 萬 次觀看
Beating RL With Reflection: GEPA and Optimize Anything — Lakshya A. Agrawal, GEPA
來源 AI Engineer
看影片(在新分頁開啟原站)連到 AI Engineer
摘要
Lakshya A. Agrawal 介紹 GEPA,一種透過完整執行軌跡與文字反思來最佳化提示詞的高效方法,比傳統強化學習更省資源。此方法能自動發現領域特定資訊,大幅提升 GPT-4.1 mini、AMD NPU 編碼代理及 ARC-AGI 等系統的表現。Optimize Anything 則將此技術擴展至程式碼、代理架構與排程策略等任何可評分之文字系統。
Lakshya A. Agrawal presents GEPA, a sample-efficient reflective optimization method that outperforms reinforcement learning by using full rollout traces to improve prompts and any text-defined systems via Optimize Anything.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- GEPA 利用完整執行軌跡進行文字反思,比傳統強化學習更省資源。
- Pareto 池機制避免陷入區域性最優,大幅提升最佳化效率。
- Optimize Anything 將此方法應用於程式碼、代理架構與排程策略等。
章節
依話題轉折切分,標題由 AI 產生
- 00:00Intro: reflective optimization
- 00:30How we teach AI new tasks
- 01:00The sample-efficiency bottleneck
- 02:05What RL throws away
- 03:00Reflecting in text space
- 04:25GEPA
- 04:50GEPA vs. GRPO: 3 examples vs. 25,000 rollouts
- 05:40What GEPA learns
- 06:55GPT-4.1 mini beats GPT-4.1
- 07:15A new AMD NPU: 4% to 30
- 08:25How GEPA works
- 09:00Why a Pareto pool beats a simple loop
- 10:10Results across benchmarks
- 10:35Beyond prompts: Optimize Anything
- 12:05The API
- 12:55A 3D unicorn
- 13:35Discovering agent harnesses: ARC-AGI from 32.5% to 89.5
- 14:40MATH-500
- 15:10Optimizing agent skills: 24% to 93
- 16:40Three optimization modes
- 17:30In production: OCR and a 90x cheaper agent
- 18:40Why better models need better prompts
- 19:10Learning evals from production traces
- 19:55Fast-slow learning: prompts and weights
- 20:20Who uses GEPA
- 20:45Get started
提到的工具與公司
- GEPA
- GRPO
- Qwen3 8B
- GPT-4.1 mini
- ADF.h
- Claude Opus
適合誰看
正在開發或最佳化 AI 代理系統、需要提升提示詞效能或處理高成本執行軌跡的工程師與技術決策者。
摘要依據
- 講者
- Lakshya A. Agrawal
- 依據
- 自動字幕
為什麼排在這裡
- 人氣
- 0.83
- 新鮮
- 0.97
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- E201|OpenAI挑战通用型AI Agent,聊聊Agent的底层架构、AGI转折点与RL人才分布Podcast ・ 硅谷101 ・ 1 小時 20 分
- 【生成式AI導論 2024】第9講:以大型語言模型打造的AI Agent (14:50 教你怎麼打造芙莉蓮一級魔法使考試中出現的泥人哥列姆)影片 ・ Hung-yi Lee ・ 25 分鐘
- Compound AI Systems Optimization: A Survey of Methods, Challenges, and Future Directions影片 ・ 陳縕儂 Vivian NTU MiuLab ・ 36 分鐘(在新分頁開啟原站)
- PureblueAI 鲁扬:把 prompt 当货架空间,把 GEO 当量化交易Podcast ・ AI炼金术 ・ 1 小時 6 分
- Is RL + LLMs enough for AGI? — Sholto Douglas & Trenton BrickenPodcast ・ Dwarkesh Podcast ・ 2 小時 24 分
- 【生成式AI導論 2024】第4講:訓練不了人工智慧?你可以訓練你自己 (中) — 拆解問題與使用工具影片 ・ Hung-yi Lee ・ 47 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
