跳到主要內容
AI 武林

Anthropic Engineering Blog

部落格 ・ 國際 ・ 英文 ・ A 級 ・ 24 筆內容 ・ 最近更新 2026/09/26

Claude Code、harness 設計、平行 agent、評測

最受歡迎

依人氣

  1. 3文章進階EN

    A postmortem of three recent issues

    這篇文章詳細分析了 Anthropic 在 8 月至 9 月間因三項基礎設施錯誤導致 Claude 回應品質間斷下降的事實。問題源於路由邏輯錯誤、TPU 編譯器精度問題以及 XLA 編譯器中的近似計算缺陷。

  2. 5文章入門EN

    The "think" tool: Enabling Claude to stop and think

    介紹了 Claude 3.7 的「think」工具,用於在生成回應前增加結構化的思考步驟。與「extended thinking」不同,它專注於處理複雜工具呼叫鏈和外部資訊,特別適合需要嚴格遵循政策、處理多步驟決策或分析工具輸出結果的場景。

  3. 6文章進階EN

    How we built our multi-agent research system

    介紹了 Anthropic 如何從原型到生產部署其多代理研究系統,並分享了系統架構、工具設計與提示工程的核心原則。文章指出,多代理系統透過分階段探索與並行處理,能更有效地處理開放式問題,大幅縮短複雜研究任務的時長。

  4. 7文章入門EN

    Building Effective AI Agents

    探討 Anthropic 如何開發可靠且具可信任性的 AI 代理系統。文章解釋了「工作流」與「代理」的架構差異,並介紹了從基礎的增強 LLM 到自主代理的演進路徑。

  5. 10文章高階EN

    Effective context engineering for AI agents

    探討了「情境工程」的概念,即如何最佳化大語言模型(LLM)的上下文視窗,以確保模型能穩定達成目標。文章指出,隨著模型能力提升,單純的提示工程已不足以應對多輪互動與長時程任務,必須透過精確管理系統指令、工具、範例及訊息歷史等要素,來平衡資訊…

最新內容

依發布時間

  1. 文章進階EN

    Best practices for Claude Code - Claude Code Docs

    介紹了 Claude Code 的最佳實踐,涵蓋環境配置、CLAUDE.md 設定、許可權管理、MCP 伺服器連線、技能建立、子代理、自動模式及自主執行等核心技巧。讀者將掌握如何高效管理上下文、最佳化驗證流程並提升開發效率。

  2. 文章高階EN

    How we contain Claude across products

    探討了 Anthropic 如何透過環境層與模型層雙重防禦,將 Claude 程式碼控制在不同產品中的風險範圍內。作者指出,雖然模型層能識別惡意指令,但環境層(如沙箱、虛擬機器)的邊界控制才是防止資料洩漏與系統破壞的關鍵。

  3. 文章入門EN

    An update on recent Claude Code quality reports

    這篇文章詳細解釋了 Anthropic 針對 Claude Code 近期報告的品質下降問題所採取的調查與修復措施。問題源於三個獨立變更:推理努力度設定錯誤、清除思考歷史的邏輯缺陷,以及系統提示詞導致冗長輸出。

  4. 文章進階EN

    Scaling Managed Agents: Decoupling the brain from the hands

    介紹了 Anthropic 推出的 Managed Agents 服務,旨在解決長程任務中「大腦」與「手」耦合的問題。透過將大腦(Claude 及其呼叫邏輯)、手(執行環境與工具)與會話記錄分離,系統能獨立容錯與替換,大幅提升系統穩定性與…

  5. 文章入門EN

    Designing AI resistant technical evaluations

    介紹了 Anthropic 為招聘效能工程師而設計的程式碼評估挑戰,該挑戰旨在抵抗 AI 輔助。作者經歷了三次迭代,每次都因 Claude 模型能力提升而被迫重新設計。

  6. 文章入門EN

    Demystifying evals for AI agents

    深入解析了如何為 AI 代理設計有效的評估體系。作者指出,由於代理具備自主性和靈活性,傳統靜態評估難以捕捉其複雜行為,因此需要結合程式碼檢查、模型評分與人工審視等多種方法。

  7. 文章入門EN

    Making Claude Code more secure and autonomous with sandboxing

    介紹了 Anthropic 推出的 Claude Code 沙盒功能,透過檔案與網路隔離,大幅減少許可權請求並提升安全性。該功能基於作業系統原語,支援沙盒執行時,允許使用者精確控制程式可存取目錄與連線伺服器。

  8. 文章高階EN

    Effective context engineering for AI agents

    探討了「情境工程」的概念,即如何最佳化大語言模型(LLM)的上下文視窗,以確保模型能穩定達成目標。文章指出,隨著模型能力提升,單純的提示工程已不足以應對多輪互動與長時程任務,必須透過精確管理系統指令、工具、範例及訊息歷史等要素,來平衡資訊…

  9. 文章進階EN

    A postmortem of three recent issues

    這篇文章詳細分析了 Anthropic 在 8 月至 9 月間因三項基礎設施錯誤導致 Claude 回應品質間斷下降的事實。問題源於路由邏輯錯誤、TPU 編譯器精度問題以及 XLA 編譯器中的近似計算缺陷。

  10. 文章進階EN

    How we built our multi-agent research system

    介紹了 Anthropic 如何從原型到生產部署其多代理研究系統,並分享了系統架構、工具設計與提示工程的核心原則。文章指出,多代理系統透過分階段探索與並行處理,能更有效地處理開放式問題,大幅縮短複雜研究任務的時長。

  11. 文章入門EN

    The "think" tool: Enabling Claude to stop and think

    介紹了 Claude 3.7 的「think」工具,用於在生成回應前增加結構化的思考步驟。與「extended thinking」不同,它專注於處理複雜工具呼叫鏈和外部資訊,特別適合需要嚴格遵循政策、處理多步驟決策或分析工具輸出結果的場景。

  12. 文章入門EN

    Building Effective AI Agents

    探討 Anthropic 如何開發可靠且具可信任性的 AI 代理系統。文章解釋了「工作流」與「代理」的架構差異,並介紹了從基礎的增強 LLM 到自主代理的演進路徑。