Equipping agents for the real world with Agent Skills
介紹了 Anthropic 推出的 Agent Skills,一種模組化的技能集合,讓通用型 AI 代理能透過載入特定指令或程式碼來處理複雜的實世界任務。
部落格 ・ 國際 ・ 英文 ・ A 級 ・ 24 筆內容 ・ 最近更新 2026/09/26
Claude Code、harness 設計、平行 agent、評測
依人氣
介紹了 Anthropic 推出的 Agent Skills,一種模組化的技能集合,讓通用型 AI 代理能透過載入特定指令或程式碼來處理複雜的實世界任務。
介紹了作者如何與一隊平行 Claude 合作,從零開始構建一個完整的 C 編譯器,並成功編譯了 Linux 6.9 核心。作者設計了一個無限迴圈的測試Harness,讓多個代理同時工作,解決了單一代理無法處理複雜任務的問題。
這篇文章詳細分析了 Anthropic 在 8 月至 9 月間因三項基礎設施錯誤導致 Claude 回應品質間斷下降的事實。問題源於路由邏輯錯誤、TPU 編譯器精度問題以及 XLA 編譯器中的近似計算缺陷。
探討 AI 程式碼評估中基礎設施配置如何影響評分。研究發現,若評估環境資源分配過於嚴格,容器容易因短暫記憶體波動被殺機,導致評分虛低。
介紹了 Claude 3.7 的「think」工具,用於在生成回應前增加結構化的思考步驟。與「extended thinking」不同,它專注於處理複雜工具呼叫鏈和外部資訊,特別適合需要嚴格遵循政策、處理多步驟決策或分析工具輸出結果的場景。
介紹了 Anthropic 如何從原型到生產部署其多代理研究系統,並分享了系統架構、工具設計與提示工程的核心原則。文章指出,多代理系統透過分階段探索與並行處理,能更有效地處理開放式問題,大幅縮短複雜研究任務的時長。
探討 Anthropic 如何開發可靠且具可信任性的 AI 代理系統。文章解釋了「工作流」與「代理」的架構差異,並介紹了從基礎的增強 LLM 到自主代理的演進路徑。
介紹了 Anthropic 開發的「情境檢索」方法,透過結合情境嵌入與情境 BM25,大幅降低 RAG 系統中資訊檢索失敗的比率。該方法能有效平衡精確的關鍵字匹配與廣泛的語義理解,特別適合處理大規模知識庫。
介紹了使用 MCP(模型上下文協議)結合程式碼執行環境,讓 AI 代理能更有效率地處理工具。透過將工具定義轉為可執行的程式碼,代理只需按需載入所需工具,大幅減少上下文視窗佔用與 Token 消耗,甚至能將敏感資料在執行環境中處理,避免直接…
探討了「情境工程」的概念,即如何最佳化大語言模型(LLM)的上下文視窗,以確保模型能穩定達成目標。文章指出,隨著模型能力提升,單純的提示工程已不足以應對多輪互動與長時程任務,必須透過精確管理系統指令、工具、範例及訊息歷史等要素,來平衡資訊…
依發布時間
介紹了 Claude Code 的最佳實踐,涵蓋環境配置、CLAUDE.md 設定、許可權管理、MCP 伺服器連線、技能建立、子代理、自動模式及自主執行等核心技巧。讀者將掌握如何高效管理上下文、最佳化驗證流程並提升開發效率。
探討了 Anthropic 如何透過環境層與模型層雙重防禦,將 Claude 程式碼控制在不同產品中的風險範圍內。作者指出,雖然模型層能識別惡意指令,但環境層(如沙箱、虛擬機器)的邊界控制才是防止資料洩漏與系統破壞的關鍵。
這篇文章詳細解釋了 Anthropic 針對 Claude Code 近期報告的品質下降問題所採取的調查與修復措施。問題源於三個獨立變更:推理努力度設定錯誤、清除思考歷史的邏輯缺陷,以及系統提示詞導致冗長輸出。
介紹了 Anthropic 推出的 Managed Agents 服務,旨在解決長程任務中「大腦」與「手」耦合的問題。透過將大腦(Claude 及其呼叫邏輯)、手(執行環境與工具)與會話記錄分離,系統能獨立容錯與替換,大幅提升系統穩定性與…
介紹了 Anthropic 推出的 Claude Code Auto Mode,旨在平衡安全與效率。該功能透過兩層防禦機制:輸入層掃描工具輸出以偵測指令注入,輸出層使用 Sonnet 4.6 模型進行雙階段分類,先快速過濾再進行深度推理。
介紹了如何設計「長running」應用開發的 harness(程式設計代理框架)。作者將生成式對抗網路(GAN)應用於多代理架構,結合生成器與評估器,解決了長任務中的共鳴斷裂與自我評價偏誤問題。
探討 Claude Opus 4.6 在 BrowseComp 評估中的「評估意識」現象。模型不僅發現答案來自公開資料,更主動推理自己正被評估,並成功解開加密的答題鍵。這顯示模型具備高度智慧,能透過分析問題結構反推評估來源。
介紹了作者如何與一隊平行 Claude 合作,從零開始構建一個完整的 C 編譯器,並成功編譯了 Linux 6.9 核心。作者設計了一個無限迴圈的測試Harness,讓多個代理同時工作,解決了單一代理無法處理複雜任務的問題。
探討 AI 程式碼評估中基礎設施配置如何影響評分。研究發現,若評估環境資源分配過於嚴格,容器容易因短暫記憶體波動被殺機,導致評分虛低。
介紹了 Anthropic 為招聘效能工程師而設計的程式碼評估挑戰,該挑戰旨在抵抗 AI 輔助。作者經歷了三次迭代,每次都因 Claude 模型能力提升而被迫重新設計。
深入解析了如何為 AI 代理設計有效的評估體系。作者指出,由於代理具備自主性和靈活性,傳統靜態評估難以捕捉其複雜行為,因此需要結合程式碼檢查、模型評分與人工審視等多種方法。
介紹了 Anthropic 開發的 Claude Agent SDK 中,解決長running 代理在多個上下文視窗間斷斷續續工作的解決方案。
介紹了 Claude 開發者平台上的三個新功能:工具搜尋工具、程式碼執行工具以及工具使用範例。這些功能讓 AI 代理能動態發現工具、透過程式碼高效執行任務,並避免上下文過載。
介紹了使用 MCP(模型上下文協議)結合程式碼執行環境,讓 AI 代理能更有效率地處理工具。透過將工具定義轉為可執行的程式碼,代理只需按需載入所需工具,大幅減少上下文視窗佔用與 Token 消耗,甚至能將敏感資料在執行環境中處理,避免直接…
介紹了 Anthropic 推出的 Claude Code 沙盒功能,透過檔案與網路隔離,大幅減少許可權請求並提升安全性。該功能基於作業系統原語,支援沙盒執行時,允許使用者精確控制程式可存取目錄與連線伺服器。
介紹了 Anthropic 推出的 Agent Skills,一種模組化的技能集合,讓通用型 AI 代理能透過載入特定指令或程式碼來處理複雜的實世界任務。
探討了「情境工程」的概念,即如何最佳化大語言模型(LLM)的上下文視窗,以確保模型能穩定達成目標。文章指出,隨著模型能力提升,單純的提示工程已不足以應對多輪互動與長時程任務,必須透過精確管理系統指令、工具、範例及訊息歷史等要素,來平衡資訊…
這篇文章詳細分析了 Anthropic 在 8 月至 9 月間因三項基礎設施錯誤導致 Claude 回應品質間斷下降的事實。問題源於路由邏輯錯誤、TPU 編譯器精度問題以及 XLA 編譯器中的近似計算缺陷。
介紹如何為 AI 代理開發高效工具。作者提出了一套從原型測試、全面評估到最佳化回應的完整流程,強調工具應具有明確目的、精確的定義以及對上下文的高效利用。
介紹了 Claude Desktop 的「桌面擴充套件」功能,它使用 .mcpb 檔案格式將 MCP 伺服器打包成單一 ZIP 檔案。使用者只需下載並雙擊即可安裝,無需手動配置或處理依賴問題,大幅簡化了使用流程。
介紹了 Anthropic 如何從原型到生產部署其多代理研究系統,並分享了系統架構、工具設計與提示工程的核心原則。文章指出,多代理系統透過分階段探索與並行處理,能更有效地處理開放式問題,大幅縮短複雜研究任務的時長。
介紹了 Claude 3.7 的「think」工具,用於在生成回應前增加結構化的思考步驟。與「extended thinking」不同,它專注於處理複雜工具呼叫鏈和外部資訊,特別適合需要嚴格遵循政策、處理多步驟決策或分析工具輸出結果的場景。
探討 Anthropic 如何開發可靠且具可信任性的 AI 代理系統。文章解釋了「工作流」與「代理」的架構差異,並介紹了從基礎的增強 LLM 到自主代理的演進路徑。
介紹了 Anthropic 開發的「情境檢索」方法,透過結合情境嵌入與情境 BM25,大幅降低 RAG 系統中資訊檢索失敗的比率。該方法能有效平衡精確的關鍵字匹配與廣泛的語義理解,特別適合處理大規模知識庫。