Building Engine v2: How LangChain approaches agent improvement
Ben Tannyhill 介紹 LangSmith Engine 如何透過自我評估與紅隊測試提升代理效能,並分享跨追蹤趨勢檢測與小模型優勢等實作經驗。
※ 摘要僅根據標題與說明
37 筆內容提到
最近 7 天 5 筆↑3(比前一期多 3 筆)(再前 7 天 2 筆)
也寫作:Langsmith
這一頁列的是「提到 LangSmith」的內容(名稱由語言模型從內容裡整理),不一定整筆都在講它。只想追它的新內容:訂閱 RSS;想找標題裡就有它的:搜尋「LangSmith」。
依發布時間,最新的 30 筆
Ben Tannyhill 介紹 LangSmith Engine 如何透過自我評估與紅隊測試提升代理效能,並分享跨追蹤趨勢檢測與小模型優勢等實作經驗。
※ 摘要僅根據標題與說明
LangChain 產品經理 Sydney Runkle 示範如何將模型路由整合到 Open SWE 程式碼代理中,透過分析任務分佈與選擇帕累託前沿模型來降低成本。看完能學會如何建立路由機制並透過 A/B 測試驗證效果。
※ 摘要僅根據標題與說明
Zip 團隊分享如何透過 LangGraph 與 LangSmith 加速 AI 功能開發與追蹤。透過這些工具,團隊無需額外編碼即可獲得節點互動與 LLM 呼叫的追蹤資料,並建立評估機制防止回退問題。
※ 摘要僅根據標題與說明
LangChain 產品經理演示如何透過單一 MCP 設定,免費為管理式深度代理加入網頁搜尋功能。影片展示從內部文件受限到整合搜尋伺服器,並在 LangSmith 中部署與檢視工具呼叫的完整流程。
※ 摘要僅根據標題與說明
Harrison Chase 分享如何透過 LangGraph 與 LangSmith 建構領域專屬智慧,並介紹 Managed Deep Agents、LangSmith Engine v2 等最新功能與觀察工具。
※ 摘要僅根據標題與說明
LangChain 產品經理 Nathan Drezner 示範如何為管理型深度代理建立自訂 HTTP 通道,讓代理能接收來自外部服務(如 HubSpot、Salesforce)的請求。
※ 摘要僅根據標題與說明
Wonder 團隊分享如何將人工除錯改為使用 LangSmith 追蹤與 LLM 評分,並透過自動化回饋迴圈最佳化提示詞管理。觀眾可學習如何建立可擴展的 AI 應用評估與維護流程。
※ 摘要僅根據標題與說明
介紹如何使用 smithtune 工具將 LangSmith 的追蹤記錄轉化為訓練資料,並對 Qwen 模型進行監督式微調。觀眾可學習如何建立金標資料集、評估軌跡品質,並完成從資料準備到模型部署的完整工作流。
※ 摘要僅根據標題與說明
LangSmith 推出 Trajectories,以時間軸方式呈現 AI 代理的完整對話路徑,讓使用者能快速定位問題根源並進行評估。此功能協助專家以易讀格式審查代理行為,並支援將資料用於監督微調。
※ 摘要僅根據標題與說明
LangSmith 推出自訂應用程式功能,讓使用者能基於代理資料建立、發布並執行自訂介面。透過模板、程式碼代理指導或提示即可快速構建,無需從零開始。
※ 摘要僅根據標題與說明
LangChain 產品團隊示範如何為管理型深度代理設定排程,使其能透過 cron 任務自動執行並將結果傳送至 Slack。觀眾可學習如何建立週期性任務,讓 AI 代理在無需人工干預的情況下定期運作。
※ 摘要僅根據標題與說明
LangSmith 推出 Engine v2,強化自動偵測與驗證 AI 代理問題的能力。新功能包含主動紅隊測試、識別更多難發現問題型別,以及自動測試修復方案並快速部署。
※ 摘要僅根據標題與說明
※ 摘要僅根據標題與說明
LangChain 團隊展示 Patch,一個將 Slack 訊息轉為 GitHub PR 的代理工具,並演示如何用 Managed Deep Agents 快速開發 Tetris 側專案功能。
※ 摘要僅根據標題與說明
介紹 TypeSafe AI 推出的 Jev 模型,一種比傳統大型語言模型快且便宜的 System 1 決策型 AI。影片示範如何用 Jev 進行模型路由、自動過濾風險工具呼叫,以及作為線上評估的評分者,並提供在 LangChain 中的…
LangChain 產品經理 Nathan Drezner 介紹管理式深度代理的中介層,示範如何加入預設的 PII 中介層來遮蔽客戶郵件,並從零編寫自訂的日誌中介層。觀眾能學習如何為代理擴展生命週期,加入政策執行、容錯與速率限制等自訂行為。
※ 摘要僅根據標題與說明
Lyft 工程師分享如何利用 LangGraph 與 LangSmith 重建客服代理架構,將開發時間從六個月縮短至兩週,並將解決率提升 16%。透過元代理架構與可觀測性工具,讓產品經理與營運人員無需寫程式即可快速部署新代理。
※ 摘要僅根據標題與說明
示範如何將 LangSmith 中的研究助理代理部署到 Slack 團隊環境,包含設定連線、授權、監控追蹤及自訂外觀。看完即可掌握將 AI 代理整合至 Slack 並讓團隊使用的具體步驟。
※ 摘要僅根據標題與說明
LangChain 產品團隊成員 Nathan 介紹 Managed Deep Agents 內建的評估能力,說明如何透過 Harbor 環境、任務與檢查機制,自動檢測模型退化並監控執行狀態。
※ 摘要僅根據標題與說明
示範如何使用 LangSmith CLI 與編碼代理建立線上 LLM 評審系統。
※ 摘要僅根據標題與說明
介紹 Clay 的評估流程,包含 3 億次代理執行與單一 LangSmith 管道。
※ 摘要僅根據標題與說明
※ 摘要僅根據標題與說明
※ 摘要僅根據標題與說明
LangSmith 預覽版本更新,讓使用者能在生產環境前測試 Agent 變更。
※ 摘要僅根據標題與說明
※ 摘要僅根據標題與說明
介紹 Toyota 如何利用 LangChain 與 LangSmith 打造製造業 AI,實現六位數投資報酬率。
※ 摘要僅根據標題與說明
※ 摘要僅根據標題與說明
教導如何從零開始構建生產級多代理系統,掌握 LangChain 與 LangGraph 的核心概念與實作技巧。學員將學習如何設計序列、並行與條件工作流,整合 RAG、記憶機制與人工介入控制,並透過實際專案將應用程式部署至 AWS 與…
Harrison Chase 與 LangChain 共同創辦人深入探討 AI 代理(Agent)如何從簡單提示演變為具備規劃、編碼與工具使用能力的複雜系統。
介紹新型態開源 AI 代理軟體 OpenClaw 的用法與安全設定,並整理近期 AI Agent 架構、評估與效能最佳化等文章重點。讀者可學習如何部署個人助理、選擇多代理設計模式,以及系統化評估 AI 表現的方法。
依人氣
教導如何從零開始構建生產級多代理系統,掌握 LangChain 與 LangGraph 的核心概念與實作技巧。學員將學習如何設計序列、並行與條件工作流,整合 RAG、記憶機制與人工介入控制,並透過實際專案將應用程式部署至 AWS 與…
介紹 TypeSafe AI 推出的 Jev 模型,一種比傳統大型語言模型快且便宜的 System 1 決策型 AI。影片示範如何用 Jev 進行模型路由、自動過濾風險工具呼叫,以及作為線上評估的評分者,並提供在 LangChain 中的…
指出許多 AI 團隊過度關注工具與架構,卻忽略了測量與迭代。作者透過實際案例說明,錯誤分析、建立簡易資料檢視器、授權領域專家撰寫提示詞、善用合成資料以及維持評估系統信任,才是提升 AI 產品成效的關鍵。
介紹 AlignEval 應用程式,讓使用者透過上傳 CSV 資料,快速完成 LLM 評估者的標籤、評估與自動最佳化。文章分享從資料出發制定評估標準的方法,並提供實作細節與工具選擇建議。
提供一套完整的實作指南,教導如何建立「以大型語言模型為裁判」的評估系統。作者透過協助超過 30 家公司的經驗,指出常見錯誤並提出「評論跟隨」技術,強調先找準領域專家、構建多樣化資料集,再迭代建立自動裁判,避免陷入無效的指標堆疊。
※ 摘要僅根據標題與說明
LangChain 產品經理 Nathan Drezner 示範如何為管理型深度代理建立自訂 HTTP 通道,讓代理能接收來自外部服務(如 HubSpot、Salesforce)的請求。
※ 摘要僅根據標題與說明
介紹如何使用 smithtune 工具將 LangSmith 的追蹤記錄轉化為訓練資料,並對 Qwen 模型進行監督式微調。觀眾可學習如何建立金標資料集、評估軌跡品質,並完成從資料準備到模型部署的完整工作流。
※ 摘要僅根據標題與說明
LangSmith 推出 Trajectories,以時間軸方式呈現 AI 代理的完整對話路徑,讓使用者能快速定位問題根源並進行評估。此功能協助專家以易讀格式審查代理行為,並支援將資料用於監督微調。
※ 摘要僅根據標題與說明