跳到主要內容
AI 武林

Hamel Husain(部落格)

部落格 ・ 國際 ・ 英文 ・ A 級 ・ 13 筆內容 ・ 最近更新 2026/09/30

最受歡迎

依人氣

  1. 1文章入門EN

    AI Evals: Everything You Need to Know

    這篇文章是針對工程師與產品經理整理的 AI 評估(Evals)常見問題解答。內容涵蓋從基礎概念(如 Trace、評估範例)到實作工具(如人工標籤、LLM 判分)的完整流程,並針對 RAG、程式碼代理等領域提供具體評估策略。

  2. 3文章進階EN

    Building an Audience Through Technical Writing: Strategies and Mistakes

    探討如何透過技術寫作建立讀者群體。作者分享六個關鍵策略:深入學習他人優秀作品、保持持續更新、提升寫作技巧、建立語音轉內容管道、運用獨特視角以及最佳化社交媒體卡片。透過這些方法,內容能自然產生更多內容,形成良性迴圈。

  3. 4文章進階EN

    Using LLM-as-a-Judge For Evaluation: A Complete Guide

    介紹了「批判影子法」(Critique Shadowing)作為使用 LLM 作為裁判的完整指南。作者指出傳統指標設計常導致資料過載和評分標準模糊,並提出透過邀請領域專家參與,建立涵蓋特徵、場景與人設的資料集,最後迭代最佳化 LLM 裁判…

  4. 5文章進階EN

    An Open Course on LLMs, Led by Practitioners

    這門由 25 位業界資深專家執導的「Mastering LLMs」線上課程,涵蓋評估、RAG、精細調教等實戰主題。課程針對有 LLM 基礎的技術人員設計,提供超過 40 小時的實作指南與資源,幫助讀者掌握如何最佳化 AI 產品。

  5. 7文章入門EN

    Debugging AI With Adversarial Validation

    介紹了「對立驗證」(Adversarial Validation) 方法,一種簡單且無需複雜基礎設施的技術,用於檢測 AI 模型的輸入資料或訓練資料是否發生突然變化。透過比較兩組資料並訓練一個二分類器,若預測能力不足則表示存在資料漂移。

  6. 9文章進階EN

    “It’s Hard to Eval” Is a Product Smell

    探討了「產品難以驗證」的常見反饋,指出這是一種產品異味。作者分享了三個案例:AI 資料代理、PE 課程建構器與工人傷害醫療報告工具,並展示了如何透過提供可驗證的 artifacts(如詳細分析筆記本、與vetted plan 的差異比較)…

  7. 10文章入門EN

    Claude’s new auto eval tool

    介紹了 Anthropic 為 Claude Code 開發的新自動評測工具,包含「hill-climb」命令協助使用者建立評測、檢查評分器並提升應用程式表現。作者指出工具常催促使用者先建立評測,且缺乏足夠上下文進行驗證,導致理解資料困難。

最新內容

依發布時間

  1. 文章入門EN

    Claude’s new auto eval tool

    介紹了 Anthropic 為 Claude Code 開發的新自動評測工具,包含「hill-climb」命令協助使用者建立評測、檢查評分器並提升應用程式表現。作者指出工具常催促使用者先建立評測,且缺乏足夠上下文進行驗證,導致理解資料困難。

  2. 文章入門EN

    AI Evals: Everything You Need to Know

    這篇文章是針對工程師與產品經理整理的 AI 評估(Evals)常見問題解答。內容涵蓋從基礎概念(如 Trace、評估範例)到實作工具(如人工標籤、LLM 判分)的完整流程,並針對 RAG、程式碼代理等領域提供具體評估策略。

  3. 文章進階EN

    “It’s Hard to Eval” Is a Product Smell

    探討了「產品難以驗證」的常見反饋,指出這是一種產品異味。作者分享了三個案例:AI 資料代理、PE 課程建構器與工人傷害醫療報告工具,並展示了如何透過提供可驗證的 artifacts(如詳細分析筆記本、與vetted plan 的差異比較)…

  4. 文章入門EN

    Selecting The Right AI Evals Tool

    探討如何選擇合適的 AI 評估工具。作者透過一場課程,讓三位專家(Langsmith、Braintrust、Arize Phoenix)完成相同的評估作業,並透過直播記錄分析其流程。文章指出,沒有單一最佳工具,選擇取決於團隊技能與技術棧。

  5. 文章進階EN

    Building an Audience Through Technical Writing: Strategies and Mistakes

    探討如何透過技術寫作建立讀者群體。作者分享六個關鍵策略:深入學習他人優秀作品、保持持續更新、提升寫作技巧、建立語音轉內容管道、運用獨特視角以及最佳化社交媒體卡片。透過這些方法,內容能自然產生更多內容,形成良性迴圈。

  6. 文章進階EN

    Using LLM-as-a-Judge For Evaluation: A Complete Guide

    介紹了「批判影子法」(Critique Shadowing)作為使用 LLM 作為裁判的完整指南。作者指出傳統指標設計常導致資料過載和評分標準模糊,並提出透過邀請領域專家參與,建立涵蓋特徵、場景與人設的資料集,最後迭代最佳化 LLM 裁判…

  7. 文章進階EN

    An Open Course on LLMs, Led by Practitioners

    這門由 25 位業界資深專家執導的「Mastering LLMs」線上課程,涵蓋評估、RAG、精細調教等實戰主題。課程針對有 LLM 基礎的技術人員設計,提供超過 40 小時的實作指南與資源,幫助讀者掌握如何最佳化 AI 產品。

  8. 文章入門EN

    Debugging AI With Adversarial Validation

    介紹了「對立驗證」(Adversarial Validation) 方法,一種簡單且無需複雜基礎設施的技術,用於檢測 AI 模型的輸入資料或訓練資料是否發生突然變化。透過比較兩組資料並訓練一個二分類器,若預測能力不足則表示存在資料漂移。