讀原文(在新分頁開啟原站)連到 AINews(Latent Space/smol.ai)
摘要
報導了 Anthropic 推出的 Claude Opus 5 模型,該模型在 Epoch Capabilities Index (ECI) 上得 159 分,略低於 Fable 5 的 161 分,但在軟體工程基準上表現等同。文章指出使用者對其程式設計代理能力的讚譽與對基準分數的質疑並存,特別關注其在中難度任務上的表現優於高難度任務,並提及 Nous Research 提供 20% 折扣。
This article reports on the launch of Anthropic's Claude Opus 5 model, which achieved an ECI of 159, slightly below Fable 5's 161, but matching it on software engineering benchmarks. User reactions vary from praise for its coding agent capabilities to skepticism about benchmark scores. Nous Research…
重點
- Claude Opus 5 在程式設計任務上表現強勁,ECI 分數 159 略低於 Fable 5 的 161 分。
- 使用者對其程式設計代理能力讚譽有加,特別強調瀏覽器控制與工具使用。
- 部分評論質疑基準分數是否低估了實際改進,呼籲更嚴格的公開基準。
提到的工具與公司
- Claude Opus 5
- Fable 5
- SWE-ECI
- FrontierCode
- Codex
- The Stack v3
適合誰看
程式開發者、AI 模型評估研究者、對 AI 工具效能感興趣的技術人員。
摘要依據
- 依據
- 文章全文
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.76
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Claude Opus 5.5 Should Raise Your Ambitions文章 ・ Don't Worry About the Vase(Zvi)
- Claude Opus 5 in 8 Minutes影片 ・ Developers Digest ・ 8 分鐘(在新分頁開啟原站)
- Claude Opus 5.5: The System Card文章 ・ Don't Worry About the Vase(Zvi)
- Opus 5.5 - The Return Of Claude?影片 ・ Mastra ・ 1 小時 15 分(在新分頁開啟原站)
- Opus 5.5 Crushes Fable & Astra影片 ・ Chase AI ・ 6 分鐘(在新分頁開啟原站)
- Opus 5.5 — Anthropic Finally Listened?影片 ・ Prompt Engineering ・ 10 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)