跳到主要內容
AI 武林

Braintrust

YouTube ・ 國際 ・ 英文 ・ B 級 ・ 1,310 訂閱 ・ 14 筆內容 ・ 最近更新 2026/09/19

最受歡迎

依人氣

  1. 2影片進階EN

    Stats for evals: Crash course(在新分頁開啟原站)

    這則影片深入解析 Braintrust 獨立評估中使用的統計概念,涵蓋點估計、樣本變異、威爾森區間、有效樣本數及對聯比較等主題,幫助讀者撰寫更精準的評估分析並識別研究論文中的關鍵指標。

    268次觀看

    ※ 摘要僅根據標題與說明

  2. 6影片入門EN

    Online workshop: Evals foundations(在新分頁開啟原站)

    Braintrust 舉辦的線上工作坊介紹了 AI 代理與傳統軟體不同的失敗模式,並教導如何建立主動觀察機制。課程涵蓋評估的重要性、實驗與演練的差異、結果分析、線上與離線評分,以及透過評估改進的完整迴圈。

    259次觀看

    ※ 摘要僅根據標題與說明

  3. 8影片進階EN

    Behavior specs for long-trajectory agents(在新分頁開啟原站)

    介紹了行為規格(behavior specs)這一新標準,用於評估持續執行數小時、執行大量決策的 AI 代理,而非僅依賴最終輸出。內容涵蓋撰寫行為規格檔案、設定 LLM 判分器,以及解析真實代理軌跡中的真、假、不適用三種判分結果。

    223次觀看

    ※ 摘要僅根據標題與說明

最新內容

依發布時間

  1. 影片進階EN

    Stats for evals: Crash course(在新分頁開啟原站)

    這則影片深入解析 Braintrust 獨立評估中使用的統計概念,涵蓋點估計、樣本變異、威爾森區間、有效樣本數及對聯比較等主題,幫助讀者撰寫更精準的評估分析並識別研究論文中的關鍵指標。

    268次觀看

    ※ 摘要僅根據標題與說明

  2. 影片入門EN

    Evaluating the GPT-5.6 family(在新分頁開啟原站)

    Braintrust 獨立測試了 GPT-5.6 系列(Sol、Terra、Luna)與 Fable 5 等六款模型,透過 225 題任務評估其表現。研究發現 Sol 在數值計算上表現最佳,而 Fable 的低分實為分類器誤報,非能力不足。

    114次觀看

    ※ 摘要僅根據標題與說明

  3. 影片入門EN

    Online workshop: Evals foundations(在新分頁開啟原站)

    Braintrust 舉辦的線上工作坊介紹了 AI 代理與傳統軟體不同的失敗模式,並教導如何建立主動觀察機制。課程涵蓋評估的重要性、實驗與演練的差異、結果分析、線上與離線評分,以及透過評估改進的完整迴圈。

    259次觀看

    ※ 摘要僅根據標題與說明

  4. 影片進階EN

    Behavior specs for long-trajectory agents(在新分頁開啟原站)

    介紹了行為規格(behavior specs)這一新標準,用於評估持續執行數小時、執行大量決策的 AI 代理,而非僅依賴最終輸出。內容涵蓋撰寫行為規格檔案、設定 LLM 判分器,以及解析真實代理軌跡中的真、假、不適用三種判分結果。

    223次觀看

    ※ 摘要僅根據標題與說明