跳到主要內容
AI 武林

Eugene Yan(部落格)

部落格 ・ 國際 ・ 英文 ・ A 級 ・ 34 筆內容 ・ 最近更新 2026/06/21

LLM 應用模式與推薦系統長文

最受歡迎

依人氣

  1. 3文章入門EN

    Don't Mock Machine Learning Models In Unit Tests

    探討了將傳統軟體測試方法應用於機器學習程式時遇到的困難。作者指出,ML 程式碼的核心是學習邏輯而非直接包含邏輯,因此測試方式必須改變:通常需透過模型推理來驗證輸出,而非直接斷言結果。

  2. 5文章入門EN

    2025 Year in Review

    2025 年作者專注於健康與職業發展,並結合 LLM 與推薦系統技術。文章分享了四個原型應用、健康資料改善、滑雪與牙齒治療的挑戰,以及 O1 簽證獲批與升遷喜訊。

  3. 7文章入門EN

    Frequently Asked Questions about My Writing Process

    這篇文章由資料科學家伊恩·揚分享,他解釋了撰寫過程的起源、目的與方法。作者從學習、分享觀點、表達異見及社群連結四方面出發,並針對個人、團隊與領導者等不同受眾,採用不同的寫作策略。

  4. 9文章高階EN

    Evaluating Long-Context Question & Answer Systems

    探討如何評估長上下文下的問答系統。作者指出,隨著文件變大,資訊過載、位置偏差、多跳推理及幻覺等問題會顯著增加。文章介紹了評估指標、如何建立評估資料集的方法,並回顧了多個文件型別(如小說、技術文獻)的測試基準,強調需同時考量忠實度與幫助性。

最新內容

依發布時間

  1. 文章入門EN

    2025 Year in Review

    2025 年作者專注於健康與職業發展,並結合 LLM 與推薦系統技術。文章分享了四個原型應用、健康資料改善、滑雪與牙齒治療的挑戰,以及 O1 簽證獲批與升遷喜訊。

  2. 文章入門EN

    Product Evals in Three Simple Steps

    這篇文章詳細介紹了建立產品評估流程的三個簡單步驟:首先標註少量資料,接著對齊 LLM 評審器,最後執行實驗並驗證配置變更。作者強調使用二進位制標籤(透過/失敗)比複雜的評分系統更有效率,並建議透過合成缺陷或主動學習來構建平衡的測試集。

  3. 文章高階EN

    Evaluating Long-Context Question & Answer Systems

    探討如何評估長上下文下的問答系統。作者指出,隨著文件變大,資訊過載、位置偏差、多跳推理及幻覺等問題會顯著增加。文章介紹了評估指標、如何建立評估資料集的方法,並回顧了多個文件型別(如小說、技術文獻)的測試基準,強調需同時考量忠實度與幫助性。

  4. 文章入門EN

    Frequently Asked Questions about My Writing Process

    這篇文章由資料科學家伊恩·揚分享,他解釋了撰寫過程的起源、目的與方法。作者從學習、分享觀點、表達異見及社群連結四方面出發,並針對個人、團隊與領導者等不同受眾,採用不同的寫作策略。

  5. 文章入門EN

    2024 Year in Review

    2024 年對作者而言是穩定進步的一年,成功將 2023 年的原型產品投入生產,並持續改善健康習慣。在寫作方面,發表了多篇技術文章,包括與朋友合著的《Building with LLMs》系列,並推出了 Tara AI Coach 和 A…

  6. 文章入門EN

    How to Run a Weekly Paper Club (and Build a Learning Community)

    介紹了如何建立每週閱讀論文俱樂部以建構學習社群。作者分享了一套完整的流程,包括如何選取論文、如何進行預讀、如何擔任主持人以及如何管理活動。透過每週固定時間的討論,讀者可以深入理解關鍵技術與模型,並建立深厚的專業網路。

  7. 文章入門EN

    AlignEval: Building an App to Make Evals Easy, Fun, and Automated

    介紹 AlignEval 是一個簡化 LLM 評估流程的應用程式。使用者只需上傳 CSV 資料、標記樣本(透過或失敗)、定義評估標準,AlignEval 就能自動最佳化評估器。作者強調應從資料出發而非預設標準,並提供實作步驟與工具推薦。

  8. 文章高階EN

    Evaluating the Effectiveness of LLM-Evaluators (aka LLM-as-Judge)

    探討了 LLM 作為裁判器(LLM-as-Judge)的效能,涵蓋了應用場景、評估技術、模型對齊及訓練方法。作者分析了直接評分、成對比較與參考評估三種方法,並討論了分類指標與相關係數指標的適用性。

  9. 文章進階EN

    Task-Specific LLM Evals that Do & Don't Work

    探討了針對特定任務(如分類、摘要、翻譯)的 LLM 評估方法,指出許多通用評估工具在實際應用中效果不佳。作者推薦了基於 NLI 的一致性檢查、NLI 模型作為事實一致性指標、以及 chrF、BLEURT 和 COMET 等翻譯質量評估指標。

  10. 文章入門EN

    Don't Mock Machine Learning Models In Unit Tests

    探討了將傳統軟體測試方法應用於機器學習程式時遇到的困難。作者指出,ML 程式碼的核心是學習邏輯而非直接包含邏輯,因此測試方式必須改變:通常需透過模型推理來驗證輸出,而非直接斷言結果。

  11. 文章進階EN

    2023 Year in Review

    回顧了 2023 年的學習與工作程序,涵蓋了撰寫 26 篇部落格文章、參與 AI 工程師峰會、投資 ML 初創公司以及個人健康調整。作者透過實際案例展示了如何將 AI 技術應用於系統設計與產品開發,並反思了從量變到質變的寫作策略。

  12. 文章入門EN

    Out-of-Domain Finetuning to Bootstrap Hallucination Detection

    探討如何利用外域資料(如維基百科摘要)進行預訓練,來提升對新聞摘要中事實不一致(即謠言)的檢測能力。作者發現,即使預訓練階段在相關領域(維基百科)上只進行了少量訓練,也能顯著改善後續在特定任務(FIB)上的表現,從而減少需要收集大量標註資…