跳到主要內容
AI 武林

評測

Evals ・ 136 筆內容

怎麼知道你的 AI 系統做得好不好:測試集、指標、LLM 當評審。

也叫做:評測、评测、evals、eval、evaluation、評估、LLM-as-judge、LLM as a judge、benchmark、benchmarks、基準測試

學習路徑

由淺入深:入門 → 進階 → 高階

  1. 入門初窺門徑

  2. 進階登堂入室

  3. 高階爐火純青

排行前 25 名

依相關、人氣、新鮮度綜合排序;站長推薦的加成

  1. 1文章Hamel Husain(部落格)入門EN

    AI Evals: Everything You Need to Know

    這篇文章是針對工程師與產品經理整理的 AI 評估(Evals)常見問題解答。內容涵蓋從基礎概念(如 Trace、評估範例)到實作工具(如人工標籤、LLM 判分)的完整流程,並針對 RAG、程式碼代理等領域提供具體評估策略。

  2. 2文章Hamel Husain(部落格)入門EN

    Claude’s new auto eval tool

    介紹了 Anthropic 為 Claude Code 開發的新自動評測工具,包含「hill-climb」命令協助使用者建立評測、檢查評分器並提升應用程式表現。作者指出工具常催促使用者先建立評測,且缺乏足夠上下文進行驗證,導致理解資料困難。

  3. 5文章Eugene Yan(部落格)入門EN

    Product Evals in Three Simple Steps

    這篇文章詳細介紹了建立產品評估流程的三個簡單步驟:首先標註少量資料,接著對齊 LLM 評審器,最後執行實驗並驗證配置變更。作者強調使用二進位制標籤(透過/失敗)比複雜的評分系統更有效率,並建議透過合成缺陷或主動學習來構建平衡的測試集。

  4. 10文章Hamel Husain(部落格)進階EN

    “It’s Hard to Eval” Is a Product Smell

    探討了「產品難以驗證」的常見反饋,指出這是一種產品異味。作者分享了三個案例:AI 資料代理、PE 課程建構器與工人傷害醫療報告工具,並展示了如何透過提供可驗證的 artifacts(如詳細分析筆記本、與vetted plan 的差異比較)…

最新

依發布時間

  1. 文章Hamel Husain(部落格)入門EN

    Claude’s new auto eval tool

    介紹了 Anthropic 為 Claude Code 開發的新自動評測工具,包含「hill-climb」命令協助使用者建立評測、檢查評分器並提升應用程式表現。作者指出工具常催促使用者先建立評測,且缺乏足夠上下文進行驗證,導致理解資料困難。