跳到主要內容
AI 武林
Podcast進階EN

GPT-5.2 Can't Identify a Serial Killer & Was The Year of Agents A Lie? EP99.28-5.2

來源 This Day in AI

聽節目(在新分頁開啟原站)連到 This Day in AI

摘要

訪談測試 OpenAI 最新推出的 GPT-5.2 模型,發現其無法識別明顯的「連續殺人犯」文字,且在工具呼叫與複雜任務上表現不佳。主持人將其與 Claude Opus 和 Gemini 3 Pro 對比,指出後者勝出,並探討了「代理模式」的幻象與企業 AI 採用現狀。

A podcast episode tests OpenAI's GPT-5.2, finding it fails basic logic tests and underperforms against competitors like Claude Opus and Gemini 3 Pro in agent tasks, while discussing the state of AI in enterprise.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • GPT-5.2 無法識別字面上寫明的連續殺人犯,邏輯能力存疑。
  • 在工具呼叫與複雜任務鏈上,GPT-5.2 表現不如 Claude Opus 和 Gemini 3 Pro。
  • 訪談深入分析了「代理模式」的幻象、企業 AI 採用困境及相關公司動態。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00GPT 5.2 效能驗證與定價調整分析
  2. 08:04OpenAI 快速部署與 Grok 審查對比
  3. 14:502025 代理時代預期落空與實驗性挑戰
  4. 18:35GPT 5.2 無法識別殺手照片之測試
  5. 24:43模型判斷失誤引發使用者信任危機
  6. 31:07企業 AI 使用隱形化與行銷話術轉變
  7. 35:18開發者與白領階層在代理技術上的差異
  8. 37:47企業 AI 匯入需漸進式學習與適應
  9. 41:34超越對話範疇邁向工具呼叫與自動化
  10. 44:56非程式員角色將獲最大生產力槓桿
  11. 47:19大模型持續進化且需求無限增長
  12. 51:41透過 MCP 解決舊系統技術債問題
  13. 54:13迪士尼與 OpenAI 達成合作而非訴訟

提到的工具與公司

  • GPT-5.2
  • Claude Opus
  • Gemini 3 Pro
  • Grok 4.1
  • Sora
  • Microsoft 365 Premium
  • Copilot
  • Simtheory

適合誰看

對 AI 模型效能、工具呼叫機制及產業動態感興趣的開發者與技術決策者。

摘要依據

講者
Michael Sharkey、Chris Sharkey
依據
語音轉文字

為什麼排在這裡

人氣
0.35
新鮮
0.32

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)