跳到主要內容
AI 武林

SWE-bench

20 筆內容提到

最近 7 天 0 筆↓2(比前一期少 2 筆)(再前 7 天 2 筆)

也寫作:SWE-Bench、SWE Bench

這一頁列的是「提到 SWE-bench」的內容(名稱由語言模型從內容裡整理),不一定整筆都在講它。只想追它的新內容:訂閱 RSS;想找標題裡就有它的:搜尋「SWE-bench」。

最新

依發布時間

  1. PodcastLatent Space進階EN

    [LIVE] Anthropic Distillation & How Models Cheat (SWE-Bench Dead) | Nathan Lambert & Sebastian Raschka

    探討 AI 模型蒸餾技術如何被用於繞過服務條款,以及 Anthropic 如何透過監控模式檢測此類攻擊。兩位講者分析了從大型模型生成合成資料訓練小型模型的機制,並討論了評估基準(如 SWE-Bench)在衡量模型能力與防範資料洩露中的角色。

最受歡迎

依人氣

  1. 1文章Shrivu Shankar(Shrivu's Substack)進階EN

    Understanding AI Benchmarks

    深入解析 AI 評測指標的運作機制與常見誤區,說明模型分數受設定、工具與評分方式影響極大。作者分析多個熱門評測(如 SWE-Bench、LMArena),指出其潛在偏差與侷限,教導讀者如何更客觀地評估模型真實能力。

  2. 7PodcastLatent Space進階EN

    [LIVE] Anthropic Distillation & How Models Cheat (SWE-Bench Dead) | Nathan Lambert & Sebastian Raschka

    探討 AI 模型蒸餾技術如何被用於繞過服務條款,以及 Anthropic 如何透過監控模式檢測此類攻擊。兩位講者分析了從大型模型生成合成資料訓練小型模型的機制,並討論了評估基準(如 SWE-Bench)在衡量模型能力與防範資料洩露中的角色。