On the success of 'natural language programming'
認為程式語言的未來是自然語言,因為需求本質上就是透過對話以自然語言定義的。文章探討了自然語言的歧義性問題,並提出透過「回饋迴路」與 AI 模型反覆對話來解決,而非追求一次性的精確轉譯。
部落格 ・ 國際 ・ 英文 ・ A 級 ・ 12 筆內容 ・ 最近更新 2026/10/04
從分散式系統的角度談 agent 基礎設施、模型推論的延遲與成本
依人氣
認為程式語言的未來是自然語言,因為需求本質上就是透過對話以自然語言定義的。文章探討了自然語言的歧義性問題,並提出透過「回饋迴路」與 AI 模型反覆對話來解決,而非追求一次性的精確轉譯。
批評 AI 代理評估指標 Pass@k 過於寬鬆,指出其數值可能虛高卻無法反映真實效能。作者透過骰子比喻說明該指標的缺陷,強調應採用更嚴苛的評估方式以確保 AI 實際可用。
評論了關於 AI 如何改變系統研究的論文,指出 AI 在具備可靠驗證器的問題空間最有效。作者強調測試與驗證的重要性,並警告過擬合與獎勵駭客等陷阱,同時探討研究者應如何從最佳化轉向選擇高價值問題。
提出未來代理式 AI 的應用機會將受缺陷率而非能力限制,並透過四象限分析不同場景的適用性。文章強調需關注左尾的缺陷問題,並介紹 AWS 在正確性編碼、規範驅動開發及工具政策等方面的具體工作方向。
探討程式設計代理(coding agents)的現狀與未來,提出關鍵觀點:擁有明確回饋機制(如錯誤訊息、效能指標)的任務較易解決,而缺乏即時回饋的任務(如架構設計、並程程式)較難。
澄清規範驅動開發(Spec Driven Development)並非回歸瀑布式開發,而是將規範作為可迭代、動態演進的活檔案。
透過歌德的詩歌比喻,闡述 AI 代理(Agent)因具備持續解決問題的能力而強大,但也因此需要明確的政策(Policy)與引導機制來約束行為,避免失控。讀者可從中理解為何固定工作流不足以應對複雜情境,並認識到建立代理行為邊界的必要性。
提出三種關於代理軟體開發的假說,認為只要有完整規範或可預測的輸入,編寫任務就會變得簡單。文章探討了這些假說在現實中的挑戰,例如任務規範不完整以及模型預測的不確定性。
分享如何從基礎大型語言模型改造成低延遲決策模型 Hobson 的實作經驗,包含架構調整、LoRA 微調與自餵訓練技巧。讀者可學習如何最佳化模型準確度與校準度,並掌握在資源受限下建構 AI 代理工具的方法。
提出用「盒子」概念來控制 AI 代理的行動,強調透過外部封閉環境限制工具呼叫與權限,以解決傳統對齊技術無法保障安全的問題。讀者能學會如何設計決定性的控制層,確保代理行為符合政策且無法繞過。
依發布時間
作者透過實驗比較使用 Qwen3.5 基礎的 Decider 模型與 T5Gemma 編碼器架構,分析雙向與單向注意力機制在準確度、校準度及延遲上的表現。
分享如何從基礎大型語言模型改造成低延遲決策模型 Hobson 的實作經驗,包含架構調整、LoRA 微調與自餵訓練技巧。讀者可學習如何最佳化模型準確度與校準度,並掌握在資源受限下建構 AI 代理工具的方法。
作者Marc Brooker表示他的部落格文章完全由人類撰寫,不使用LLM進行寫作,但會大量使用智慧體進行研究與整理。他認為閱讀AI生成的文字違反了社會契約,強調內容應反映作者真實的理解與投入,而非用AI填充篇幅。
提出三種關於代理軟體開發的假說,認為只要有完整規範或可預測的輸入,編寫任務就會變得簡單。文章探討了這些假說在現實中的挑戰,例如任務規範不完整以及模型預測的不確定性。
探討程式設計代理(coding agents)的現狀與未來,提出關鍵觀點:擁有明確回饋機制(如錯誤訊息、效能指標)的任務較易解決,而缺乏即時回饋的任務(如架構設計、並程程式)較難。
提出未來代理式 AI 的應用機會將受缺陷率而非能力限制,並透過四象限分析不同場景的適用性。文章強調需關注左尾的缺陷問題,並介紹 AWS 在正確性編碼、規範驅動開發及工具政策等方面的具體工作方向。
澄清規範驅動開發(Spec Driven Development)並非回歸瀑布式開發,而是將規範作為可迭代、動態演進的活檔案。
透過歌德的詩歌比喻,闡述 AI 代理(Agent)因具備持續解決問題的能力而強大,但也因此需要明確的政策(Policy)與引導機制來約束行為,避免失控。讀者可從中理解為何固定工作流不足以應對複雜情境,並認識到建立代理行為邊界的必要性。
批評 AI 代理評估指標 Pass@k 過於寬鬆,指出其數值可能虛高卻無法反映真實效能。作者透過骰子比喻說明該指標的缺陷,強調應採用更嚴苛的評估方式以確保 AI 實際可用。
提出用「盒子」概念來控制 AI 代理的行動,強調透過外部封閉環境限制工具呼叫與權限,以解決傳統對齊技術無法保障安全的問題。讀者能學會如何設計決定性的控制層,確保代理行為符合政策且無法繞過。
認為程式語言的未來是自然語言,因為需求本質上就是透過對話以自然語言定義的。文章探討了自然語言的歧義性問題,並提出透過「回饋迴路」與 AI 模型反覆對話來解決,而非追求一次性的精確轉譯。
評論了關於 AI 如何改變系統研究的論文,指出 AI 在具備可靠驗證器的問題空間最有效。作者強調測試與驗證的重要性,並警告過擬合與獎勵駭客等陷阱,同時探討研究者應如何從最佳化轉向選擇高價值問題。