Podcast進階EN
humans& with Alexis Ross, Manya Bansal, and Niloofar Mireshghallah - Weaviate Podcast #145!
聽節目(在新分頁開啟原站)連到 Weaviate Podcast
摘要
三位專家訪談 Persimmon,一款模擬人類在多人多輪對話中自然行為的 AI 模型。它不追求像助手那樣總是 helpful,而是捕捉挫折、興奮等真實摩擦,並透過多輪圖靈測試作為評估指標,探討如何訓練非可驗證任務的 AI。
Experts discuss Persimmon, an AI model simulating natural human behavior in multi-party conversations, and evaluate it using multi-turn Turing tests.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- Persimmon 模擬人類在多人對話中的自然摩擦與行為分佈。
- 透過多輪圖靈測試評估,現有模型難以長期欺騙人類。
- 提出以隱式特徵空間的分佈匹配替代人工定義的評估指標。
章節
依話題轉折切分,標題由 AI 產生
- 00:00Alexis 與 Manya 的學術背景與加入 Humans
- 02:18Persimmon 如何模擬人類而非僅是助手
- 07:18Persimmon 在 Turing 測試中的表現與挑戰
- 09:47人類評估 AI 的難點與產品化倫理思考
- 14:47拒絕數學基準,追求模糊的人性特質
- 19:38學術與產業在模型評估與資料上的差異
- 27:11Tides 資料集來源與分佈視覺化工具的侷限
- 29:40真實對話比角色扮演更能測試 AI
- 36:54擬人化資料庫查詢與 Nemo 模型體驗
- 39:38無後訓練優勢與狀態空間模型特性
- 43:09避免過度依賴既有行為的訓練策略
- 45:18無法透過提示最佳化解決模式崩塌
- 51:16感謝訪談與對未來 AI 發展方向展望
提到的工具與公司
- Persimmon
適合誰看
對 AI 使用者建模、非可驗證任務訓練及評估指標感興趣的研究者與開發者。
摘要依據
- 講者
- Connor Shorten
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.16
- 新鮮
- 0.93
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Reality: The Final Eval — Lukas Petersson and Axel Backlund of Andon LabsPodcast ・ Latent Space ・ 1 小時 16 分
- Introducing MentalHealthBench文章 ・ OpenAI News
- Webinar: AI Agent Simulation of Human Behavior with Michael Bernstein影片 ・ Stanford Online ・ 1 小時
- Simon Obstbaum & Rob Willoughby - Why evals are hard and how we're solving it - AI Native DevCon Jun影片 ・ AI Native Dev ・ 37 分鐘
- AI That Acts: Devin Fusion, Persimmon, Programmable Worlds & Amodei’s Slowdown CallPodcast ・ Turing Post ・ 18 分鐘
- Why Tejal Patwardhan stopped underestimating the models - Episode 21Podcast ・ OpenAI Podcast ・ 44 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
