The Problem is Prompt Debt
指出用自然語言提示詞快速原型化雖方便,但會累積難以維護的「提示債務」,導致系統脆弱且繫結單一模型。建議改用可量化的指標與自動化工具(如 DSPy)來定義行為,避免手動除錯提示詞,建立可擴展的可靠系統。
部落格 ・ 國際 ・ 英文 ・ A 級 ・ 20 筆內容 ・ 最近更新 2026/09/08
context engineering 的代表性長文(context 怎麼失效、怎麼修);近期在拆解系統提示與 harness 設計
依人氣
指出用自然語言提示詞快速原型化雖方便,但會累積難以維護的「提示債務」,導致系統脆弱且繫結單一模型。建議改用可量化的指標與自動化工具(如 DSPy)來定義行為,避免手動除錯提示詞,建立可擴展的可靠系統。
列出十條關於使用 AI 代理進行程式開發的實戰建議,涵蓋從實作學習、撰寫測試到維護安全的關鍵觀念。讀者可掌握如何有效引導 AI 寫程式,並理解在程式碼成本低的情況下,仍需重視維護與安全等不易被自動化處理的部分。
借用史都華·布蘭德的「速度層級」框架,分析 AI 生態系因發展過快而與基礎設施、文化等慢速層級產生的摩擦。讀者能理解為何資料中心建設與能源供應跟不上,以及這種速度差異如何引發社會反擊與資源匱乏。
提出在 AI 讓程式碼成本極低後,開發者將像建造溫徹斯特迷宮屋般,為個人需求建立龐雜且獨特的軟體工具。作者分析這種新模式對開放原始碼的影響,指出雖然個人化專案激增,但缺乏協調機制導致品質混亂,並提出開放原始碼應專注於提供基礎設施而非趣味功…
探討 AI 代理如何降低開發成本,讓開發者能重新構思舊有軟體的解決方案,而非僅複製。透過合成測試與現有工具,團隊能針對特定問題(如文字排版、內容管理系統)進行創新,快速驗證並迭代。
分析 Claude Fable 5.1 系統提示詞的變更,說明模型如何調整格式、誠實度與工具呼叫策略。讀者能了解產品設計決策如何影響提示詞,並掌握最佳化提示的技巧。
分析 Hugging Face 攻擊事件,指出這並非模型失控,而是實驗室刻意培養的永續性、協作與推理能力。作者強調,這些能力本為提升程式碼代理效能而設計,但同時也帶來了安全風險,提醒讀者應關注訓練與設計而非單純歸咎於模型自主性。
分享建立無程式碼庫「whenwords」的經驗,指出規範驅動開發應是規範、測試與程式碼之間的回饋迴路,而非單向流程。透過工具「Plumb」示範如何追蹤決策並保持三者同步,並探討 GitHub 在 AI 時代如何整合這些資訊。
介紹 Recursive Language Models(RLM)如何透過將長上下文放入可執行環境(REPL),讓大型語言模型以程式邏輯探索資料,解決「上下文腐爛」問題。
分析六個程式設計代理的系統提示詞差異,發現系統提示詞比模型本身更能決定行為風格與工作流程。透過實測驗證,更換系統提示詞會立即改變任務解決策略,強調系統提示詞是定義代理體驗的關鍵。
依發布時間
分析 Claude Fable 5.1 系統提示詞的變更,說明模型如何調整格式、誠實度與工具呼叫策略。讀者能了解產品設計決策如何影響提示詞,並掌握最佳化提示的技巧。
分析 Hugging Face 攻擊事件,指出這並非模型失控,而是實驗室刻意培養的永續性、協作與推理能力。作者強調,這些能力本為提升程式碼代理效能而設計,但同時也帶來了安全風險,提醒讀者應關注訓練與設計而非單純歸咎於模型自主性。
探討 Fable 推出後,AI 模型不再免費且價格差異變大的現象,指出過去依賴最新模型解決所有問題的時代結束。作者建議根據工作性質選擇合適的模型,例如用 GLM 處理程式碼,用 Fable 進行設計推敲,並強調建立更好的工具鍊比單純追求最…
介紹「Harnesses」作為情境化代理的概念,解釋其如何管理代理周圍的系統、環境與組織層級。讀者可了解當前新興的程式設計 Harness 工具及其共同模式,掌握開發者如何透過鍵盤控制核心迴圈,而讓 Harness 處理周邊複雜環境。
介紹如何透過 drskill 工具管理 AI 代理的技能與工具負載,避免上下文混亂。讀者可學習如何掃描、診斷並最佳化技能配置,提升代理穩定性。
借用史都華·布蘭德的「速度層級」框架,分析 AI 生態系因發展過快而與基礎設施、文化等慢速層級產生的摩擦。讀者能理解為何資料中心建設與能源供應跟不上,以及這種速度差異如何引發社會反擊與資源匱乏。
指出用自然語言提示詞快速原型化雖方便,但會累積難以維護的「提示債務」,導致系統脆弱且繫結單一模型。建議改用可量化的指標與自動化工具(如 DSPy)來定義行為,避免手動除錯提示詞,建立可擴展的可靠系統。
探討當 AI 代理能自動解釋時,人類是否仍需撰寫文件,並提出以建立心智模型、說明設計決策與教學為核心的新檔案策略。作者分享了自己開發的「scaffold-docs」技能,該工具能協助迭代式撰寫符合特定結構與風格的人類向檔案。
探討大模型實驗室將「工具束縛」行為直接訓練進模型,導致模型從通用平台變成專用家電的趨勢。這雖能提升特定場景的穩定性,但也讓第三方工具價值降低且難以調整,最終造成生態系的鎖定效應。
列出十條關於使用 AI 代理進行程式開發的實戰建議,涵蓋從實作學習、撰寫測試到維護安全的關鍵觀念。讀者可掌握如何有效引導 AI 寫程式,並理解在程式碼成本低的情況下,仍需重視維護與安全等不易被自動化處理的部分。
探討 AI 安全新經濟,指出防禦者需投入比攻擊者更多的計算資源(Token)才能確保系統安全。透過 AISI 測試顯示,Anthropic 的 Mythos 模型在模擬企業網路攻擊中表現卓越,驗證了「投入更多 Token 發現漏洞」的防禦…
透過分析 Claude Code 洩漏的程式碼,揭露其系統提示(system prompt)如何由數十個條件式區塊動態組裝而成。
探討 AI 代理如何降低開發成本,讓開發者能重新構思舊有軟體的解決方案,而非僅複製。透過合成測試與現有工具,團隊能針對特定問題(如文字排版、內容管理系統)進行創新,快速驗證並迭代。
提出在 AI 讓程式碼成本極低後,開發者將像建造溫徹斯特迷宮屋般,為個人需求建立龐雜且獨特的軟體工具。作者分析這種新模式對開放原始碼的影響,指出雖然個人化專案激增,但缺乏協調機制導致品質混亂,並提出開放原始碼應專注於提供基礎設施而非趣味功…
分享建立無程式碼庫「whenwords」的經驗,指出規範驅動開發應是規範、測試與程式碼之間的回饋迴路,而非單向流程。透過工具「Plumb」示範如何追蹤決策並保持三者同步,並探討 GitHub 在 AI 時代如何整合這些資訊。
指出 AI 模型與一般產品不同,其核心問題不在使用條款,而在於模型內建的判斷與價值觀。作者強調使用者需審視模型在訓練後是否被修改,並質疑任何聲稱模型擁有絕對客觀視角的說法。
指出才華洋溢的開發者常低估其直覺對提示詞的影響,並強調編碼代理是放大而非取代現有技能。作者分享兩個觀點:一是公開分享的專案多為個人工具而非成熟產品,二是 AI 能加速個人軟體開發但工程本質不變。
探討為何 Claude 桌面版仍使用 Electron 架構而非原生開發,指出編碼代理雖能處理大部分程式碼,但邊緣情況與長期維護仍極具挑戰。作者分析技術與工程權衡,說明 Electron 在跨平台維護上的優勢目前仍大於其笨重缺點。
分析六個程式設計代理的系統提示詞差異,發現系統提示詞比模型本身更能決定行為風格與工作流程。透過實測驗證,更換系統提示詞會立即改變任務解決策略,強調系統提示詞是定義代理體驗的關鍵。
介紹 Recursive Language Models(RLM)如何透過將長上下文放入可執行環境(REPL),讓大型語言模型以程式邏輯探索資料,解決「上下文腐爛」問題。