Podcast進階EN
GPT-5.2 Can't Identify a Serial Killer & Was The Year of Agents A Lie? EP99.28-5.2
聽節目(在新分頁開啟原站)連到 This Day in AI
摘要
訪談測試 OpenAI 最新推出的 GPT-5.2 模型,發現其無法識別明顯的「連續殺人犯」文字,且在工具呼叫與複雜任務上表現不佳。主持人將其與 Claude Opus 和 Gemini 3 Pro 對比,指出後者勝出,並探討了「代理模式」的幻象與企業 AI 採用現狀。
A podcast episode tests OpenAI's GPT-5.2, finding it fails basic logic tests and underperforms against competitors like Claude Opus and Gemini 3 Pro in agent tasks, while discussing the state of AI in enterprise.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- GPT-5.2 無法識別字面上寫明的連續殺人犯,邏輯能力存疑。
- 在工具呼叫與複雜任務鏈上,GPT-5.2 表現不如 Claude Opus 和 Gemini 3 Pro。
- 訪談深入分析了「代理模式」的幻象、企業 AI 採用困境及相關公司動態。
章節
依話題轉折切分,標題由 AI 產生
- 00:00GPT 5.2 效能驗證與定價調整分析
- 08:04OpenAI 快速部署與 Grok 審查對比
- 14:502025 代理時代預期落空與實驗性挑戰
- 18:35GPT 5.2 無法識別殺手照片之測試
- 24:43模型判斷失誤引發使用者信任危機
- 31:07企業 AI 使用隱形化與行銷話術轉變
- 35:18開發者與白領階層在代理技術上的差異
- 37:47企業 AI 匯入需漸進式學習與適應
- 41:34超越對話範疇邁向工具呼叫與自動化
- 44:56非程式員角色將獲最大生產力槓桿
- 47:19大模型持續進化且需求無限增長
- 51:41透過 MCP 解決舊系統技術債問題
- 54:13迪士尼與 OpenAI 達成合作而非訴訟
提到的工具與公司
- GPT-5.2
- Claude Opus
- Gemini 3 Pro
- Grok 4.1
- Sora
- Microsoft 365 Premium
- Copilot
- Simtheory
適合誰看
對 AI 模型效能、工具呼叫機制及產業動態感興趣的開發者與技術決策者。
摘要依據
- 講者
- Michael Sharkey、Chris Sharkey
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.35
- 新鮮
- 0.32
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- A Guide to Which AI to Use in the Agentic Era文章 ・ Ethan Mollick(部落格)
- The State of A.I. 2025 (ft Richardson Dackam)Podcast ・ Tool Use - AI Conversations ・ 59 分鐘
- Is GPT-5.5 Better Than Opus Now? (ft. Our New AI Co-Host) - EP99.38Podcast ・ This Day in AI ・ 47 分鐘
- GPT 5.2: OpenAI Strikes Back影片 ・ AI Explained ・ 18 分鐘(在新分頁開啟原站)
- 愛好 AI Engineer 電子報 🚀 2025 Q4 AI 模型與 Agent 開發 #33文章 ・ ihower(張文鈿)
- Episode 8Podcast ・ Raising An Agent ・ 53 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
