Really Big Test-Time Compute in AI Changes Benchmarks, Safety and Research with OpenAI Research Scientist Noam Brown(在新分頁播放音檔)
Noam Brown 探討 AI 傳統評測標準的瓶頸,提出測試時計算量(test-time compute)能大幅提升模型推理能力。他說明若妥善設計,模型可進行長週期的複雜推理,並討論了由此帶來的安全評估與自我改進挑戰。
※ 摘要僅根據標題與說明



























