An ex-OpenAI researcher just deleted language from the LLM...
介紹前 OpenAI 研究員 Diogo Almeida 開發的 Jev 模型,該模型刪除語言能力,僅做分類與判斷,速度與成本大幅降低且無幻覺。觀眾可了解其運作原理、應用場景及與傳統大型語言模型的差異。
09/21–09/27 497 筆新內容
影片 315、Podcast 82、文章 100;中文 92、英文 405;251 筆的摘要有根據原文。前一期 352 筆(↑145)。
這一頁是每次更新網站時自動整理的,沒有人工挑選:依發布日期歸到這段期間,照人氣排(有原文的優先),同一個來源最多兩筆,個人部落格與大頻道各佔一半。想固定收到的話可以訂閱每週回顧的 RSS(每週一出一篇)。
這段期間的內容最常提到的工具與主題,數字是筆數,與前一期相比
這一週人氣最高的
介紹前 OpenAI 研究員 Diogo Almeida 開發的 Jev 模型,該模型刪除語言能力,僅做分類與判斷,速度與成本大幅降低且無幻覺。觀眾可了解其運作原理、應用場景及與傳統大型語言模型的差異。
解釋大模型參數中儲存的「參數知識」與上下文知識的差異,說明模型如何透過預測文字來模擬知識,並指出因訓練資料稀釋或過時而產生的幻覺問題。讀者可理解模型知識來源的機制,並學會如何透過補充上下文來解決特定領域的知識缺口。
涵蓋 Claude 認證開發者基礎考試內容,教導如何建置與整合生產級應用、代理與工作流。學員將學習代理架構、API 機制、提示工程及 MCP 伺服器等實務技能,並透過實作實驗掌握工具使用。
探討「AI」這個詞的含義如何隨著技術演進而改變,從符號推理到大型語言模型。作者建議在技術討論中避免使用模糊的「AI」一詞,應改用具體的名稱如模型或工具。
展示 Claude Opus 5.5 如何模擬複雜物理現象與生物運動,包括蜂蜜捲曲與虛擬角色行走,展現超越現有模型的實時模擬能力。內容同時探討其潛在風險,如自我懷疑行為與幻覺問題,並介紹 Lambda 平台用於執行實驗。
Geoffrey Huntley 回顧他在 AI Engineer Singapore 的演講,探討 AI 如何讓軟體開發成本低於最低工資,並讓非工程師也能進行開發。
作者用 Claude Opus 5.5 測試不同努力等級(低、中、高、極、極致、超程式碼)生成同一個 3D 虛擬會議場景的效果。影片詳細比較了各等級的品質、耗時、API 成本、Token 用量與檢查次數,並分析哪種設定最適合複雜創意專案。
評論了 OpenAI 與 Anthropic 發布的新模型 GPT-6 Sol/Luna 及 Claude Opus 5.5,指出價格戰激烈,GPT-6 Luna 價格極低。
說明 AI 如何讓敏感資料在訓練、提示詞與工具使用中無形洩漏,並指出傳統防護不足。透過工作負載與人力視角追蹤資料流向,建立端到端可見性以主動識別風險。
介紹一場在舊金山舉辦的技術分享活動,邀請開發者聚集討論程式設計代理的實驗與探索。讀者可透過此活動與其他建構者交流,分享未公開的專案與實驗心得。
每天挑幾筆;全部的在搜尋頁依最新排序
AI Is Exposing Your Data: An AI Security Problem You Can't See
說明 AI 如何讓敏感資料在訓練、提示詞與工具使用中無形洩漏,並指出傳統防護不足。透過工作負載與人力視角追蹤資料流向,建立端到端可見性以主動識別風險。
IBM Technology11 分鐘● 有原文
the eighteen-month recap: AI Engineer, Singapore, May 2026
Geoffrey Huntley 回顧他在 AI Engineer Singapore 的演講,探討 AI 如何讓軟體開發成本低於最低工資,並讓非工程師也能進行開發。
Geoffrey Huntley(部落格)● 有原文
What It Actually Takes to Build a Software Factory — Tereza Tížková, Factory
由 Factory 公司創辦人 Tereza Tížková 演講,定義軟體工廠為涵蓋完整軟體生命週期的自主迴圈,而非僅是編碼。她強調建立軟體工廠需遵循三大原則:對模型與團隊工作流保持中立、讓代理自主長時間執行、並持續改進系統。
AI Engineer23 分鐘● 有原文
分享如何用 Claude Opus 5.5 生成畫素動畫,並搭配 Playwright 自動點選製作影片。讀者可學習如何將 AI 繪圖與自動化測試結合,製作個人化演示素材。
Simon Willison's Weblog● 有原文
How to use GitHub Copilot with WSL on Windows
示範如何在 Windows 上透過 WSL 使用 GitHub Copilot 應用程式,將 Linux 環境與程式碼助手整合。觀眾可學習如何設定遠端環境、啟動並管理多個並行開發工作區,以及直接在應用程式內預覽與測試程式變更。
GitHub6 分鐘● 有原文
How We Built an Agent That Improves Itself — Zubin Aysola, Weights & Biases
Weights & Biases 分享其自研的 ARIA 軟體代理如何透過生產與離線環境的完全一致程式碼,將實際使用者軌跡轉化為評估任務,自動發現並修復自身缺陷。
AI Engineer17 分鐘● 有原文
Opus 5.5 Just Changed Video Editing Forever (free skills)
詳細拆解如何使用 Claude Opus 5.5 搭配 Hyperframes 工具,透過單一指令完成高品質的影片剪輯、動態設計與音效製作。
Nate Herk | AI Automation19 分鐘● 有原文
探討 AI 代理如何改變程式開發,認為語法與工具細節不再重要,效能與可觀察性才是關鍵。作者預測傳統框架與語言選擇的邏輯將被重寫,並分享對未來開發趨勢的觀察與思考。
Thorsten Ball(部落格)● 有原文
Robot-Use Agents: Why General-Purpose Models May Win in Robotics
探討通用大模型如何控制機器人,分析從編碼代理到機器人政策的演進。透過 Waddle Labs 與 RoboCurve 的實作經驗,說明如何利用程式碼作為策略、情境學習與工具呼叫,讓模型在無需大量機器人特定訓練的情況下掌握物理任務。
Y Combinator30 分鐘● 有原文
Build A Reasoning Model From Scratch 5: Inference Scaling 2 (Logprob Scoring, Self-Refinement)
介紹推理模型推論時的評分函式與自我改進技術,包含使用對數機率分數解決平手情況及實作自我修正迴圈。觀眾可學習如何計算 token 機率、評估模型答案並最佳化推理過程。
Sebastian Raschka1 小時 9 分○ 無原文
Opus 5.5 正式发布!Claude 最新模型有多强?实测做动画、游戏、写代码,结果出乎意料! | 零度解说
實測 Claude Opus 5.5 在寫程式、做動畫、生成遊戲與互動地圖等任務上的表現,並對比 GPT-6 的效能與成本。看完能了解該模型在處理長流程專案與複雜創意任務上的實際能力與優勢。
零度解说11 分鐘● 有原文
How to Apply Data Science Skills to AI Engineering
分享作者從資料科學到 AI 工程實踐的經驗,強調建立可測量的 AI 產品評估方法的重要性。
Hamel Husain4 分鐘○ 無原文
I Had Opus 5.5 Build me the Same App at Every Effort Level
作者用 Claude Opus 5.5 測試不同努力等級(低、中、高、極、極致、超程式碼)生成同一個 3D 虛擬會議場景的效果。影片詳細比較了各等級的品質、耗時、API 成本、Token 用量與檢查次數,並分析哪種設定最適合複雜創意專案。
Nate Herk | AI Automation27 分鐘● 有原文
探討 Coding Agents 如何讓軟體工程更困難,強調需極高自律與知識才能發揮其潛力。
Simon Willison's Weblog● 有原文
8 Jev Use Cases That Feel Like Cheating
介紹 Jev 這新型 AI 決策工具,它能極速處理大量判斷任務,如檢測 AI 生成內容、過濾網頁雜訊、自動排序郵件與搜尋。透過具體實作示範,展示其在網頁生成、影片剪輯與顏色搭配等場景的應用潛力。
Matthew Berman11 分鐘● 有原文
Raising an Agent - Stop Boxing In Your Agent (Season 2, Episode 5)
探討工程師對 AI 的過度保守心態,指出限制 Token 預算或選用便宜模型反而導致效率降低與成本上升。內容強調現代 Agent 已能獨立完成程式碼撰寫、測試與生產部署,並呼籲企業打破舊有流程壁壘,讓 AI 真正融入工作流。
Amp, Inc.56 分鐘● 有原文
Getting the most out of Opus 5.5
介紹如何有效使用 Opus 5.5 模型,包含定義完成狀態、避免使用 Max 推理模式、利用截圖輔助以及引導模型與人類協作的技巧。
Theo - t3․gg29 分鐘● 有原文
展示如何將現有的 Laravel 新聞郵件應用程式轉換為 Amp 專案,並使用 Orbs 讓代理進行環境配置與問題修復。觀眾能學習如何使用 Orbs 管理應用程式狀態與快取快照。
Amp, Inc.15 分鐘○ 無原文
Claude Opus 5.5 AI: An Incredible Leap Forward
展示 Claude Opus 5.5 如何模擬複雜物理現象與生物運動,包括蜂蜜捲曲與虛擬角色行走,展現超越現有模型的實時模擬能力。內容同時探討其潛在風險,如自我懷疑行為與幻覺問題,並介紹 Lambda 平台用於執行實驗。
Two Minute Papers5 分鐘● 有原文
Parametric knowledge | AI Coding Dictionary
解釋大模型參數中儲存的「參數知識」與上下文知識的差異,說明模型如何透過預測文字來模擬知識,並指出因訓練資料稀釋或過時而產生的幻覺問題。讀者可理解模型知識來源的機制,並學會如何透過補充上下文來解決特定領域的知識缺口。
AI Hero(Matt Pocock)● 有原文
Using Claude Opus 5.5 as your daily driver
展示 Claude Opus 5.5 相比前代 Opus 5 在速度、準確度與成本上的提升,透過實際程式碼修復案例對比兩者表現。觀眾能了解如何設定努力程度與使用子代理來最佳化效能,並掌握 API 審計命令的用法。
Claude4 分鐘● 有原文
探討「AI」這個詞的含義如何隨著技術演進而改變,從符號推理到大型語言模型。作者建議在技術討論中避免使用模糊的「AI」一詞,應改用具體的名稱如模型或工具。
AI Hero(Matt Pocock)● 有原文
I Tested Opus 5.5 vs. GPT-6 Astra on 12 Real Use Cases
編輯在 12 個真實場景中對比測試 Opus 5.5 與 GPT-6 Astra 的表現,涵蓋網頁設計、影片剪輯、遊戲開發與程式編寫等任務。
Nate Herk | AI Automation43 分鐘● 有原文
介紹 Google 新推出的 Gemini 3.8 TTS 模型與自訂聲音功能,並展示用 GPT-6 Astra 編寫的測試介面。讀者可了解如何快速生成多角色對話語音及相關成本。
Simon Willison's Weblog● 有原文
MiniMax H3 越狱拍大片!无审查生成长视频,支持剧情演绎、分镜控制!本地部署来了 | 零度解说
示範如何使用 Minimax H3 越獄模型與 Converse 客戶端,在本地部署生成帶劇情的長影片。觀眾可學習如何透過分鏡詞控制人物動作與鏡頭,並調整參數以最佳化輸出效果。
零度解说10 分鐘● 有原文
Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war
評論了 OpenAI 與 Anthropic 發布的新模型 GPT-6 Sol/Luna 及 Claude Opus 5.5,指出價格戰激烈,GPT-6 Luna 價格極低。
Simon Willison's Weblog● 有原文
I Tested Opus 5.5 vs. GPT-6 Sol on 10 Real Use Cases
測試 Opus 5.5 與 GPT-6 Sol 在網站設計、影片剪輯、程式碼修復等 10 項真實任務中的表現。結果顯示 Opus 5.5 在創意與判斷力上勝出,而 GPT-6 Sol 則因價格低廉且執行特定指令更穩定,兩者各有優劣。
Nate Herk | AI Automation34 分鐘● 有原文
SF October 14th: A Birds of a Feather Session on Agentic Engineering
介紹一場在舊金山舉辦的技術分享活動,邀請開發者聚集討論程式設計代理的實驗與探索。讀者可透過此活動與其他建構者交流,分享未公開的專案與實驗心得。
Simon Willison's Weblog● 有原文
Full Course: Spec-Driven Development with Coding Agents
教導如何透過撰寫明確的 Markdown 規格文件,引導程式碼代理(Coding Agent)進行開發,以取代依賴隨機性的「氛圍編碼」。學員將學習如何建立專案憲章、規劃功能並驗證結果,從而提升程式碼品質與可維護性。
DeepLearningAI1 小時 2 分● 有原文
NTU/TAICA Machine Learning 2026 Fall Week 3
NTU/TAICA 機器學習 2026 秋季第 3 週課程影片,由林軒田講授。
Hsuan-Tien Lin3 小時 1 分○ 無原文
An ex-OpenAI researcher just deleted language from the LLM...
介紹前 OpenAI 研究員 Diogo Almeida 開發的 Jev 模型,該模型刪除語言能力,僅做分類與判斷,速度與成本大幅降低且無幻覺。觀眾可了解其運作原理、應用場景及與傳統大型語言模型的差異。
Fireship5 分鐘● 有原文
介紹 llm-typesafe 0.1a0 外掛,支援 TypeSafe AI 的 Jev 模型,可執行 yes/no、選擇與評分等任務。讓使用者能透過指令式介面處理 LLM 的結構化回應。
Simon Willison's Weblog● 有原文
Understand Local AI in 15 Minutes
介紹本地 AI 的定義、硬體需求與最佳模型選擇,並提供從入門到高階的三種實際設定方案。看完後你能了解如何根據記憶體與頻寬選擇適合的模型,並判斷何時該用雲端還是本地 AI。
Tech With Tim17 分鐘● 有原文
Jev introduces a new shape of LLM - System One, aka Decision Models
TypeSafe AI 推出新型「決策模型」Jev,取代傳統 LLM 的文字輸出,直接返回分類、評分等浮點數與置信度。使用者可透過 API 提出是/否、選擇或評分問題,僅按輸入付費,成本極低且速度快。
Simon Willison's Weblog● 有原文
介紹 TypeSafe AI 推出的 Jev 模型,一種比傳統大型語言模型快且便宜的 System 1 決策型 AI。影片示範如何用 Jev 進行模型路由、自動過濾風險工具呼叫,以及作為線上評估的評分者,並提供在 LangChain 中的…
LangChain9 分鐘● 有原文
Debating RSI, the US-China Gap, and Jaggedness with JS Denain of Epoch AI
訪談探討了 AI 自我加速(RSI)的預測、中美模型能力差距的原因、機器人角色以及前沿模型後訓練的具體流程。兩位講者分享了對 AI 發展軌跡的不確定性,並分析了資料、算力與人力資源如何影響中國實驗室與美國實驗室之間的競爭態勢。
Interconnects1 小時 5 分● 有原文
Claude Certified Developer Foundations (CCDV-F) Certification Course
涵蓋 Claude 認證開發者基礎考試內容,教導如何建置與整合生產級應用、代理與工作流。學員將學習代理架構、API 機制、提示工程及 MCP 伺服器等實務技能,並透過實作實驗掌握工具使用。
freeCodeCamp.org6 小時 58 分● 有原文
The current balance of power in open models
Podcast 訪談探討 2026 年開放權重 AI 模型的全球權力平衡,指出中國模型在商業可行性與下載量上已超越美國。內容分析開放模型與封閉模型的差異、學術界採用趨勢、技術演進速度,以及由此帶來的資安風險與監管不確定性。
Interconnects18 分鐘● 有原文
介紹 Typesafe AI 推出的 Jev 模型,這是一款專為資料分類與結構化輸出設計的「系統一」模型,速度極快且成本低廉。影片示範了其在即時分類、自動化流程中的應用,並對比傳統語言模型在處理分類任務時的效率差距。
Theo - t3․gg30 分鐘● 有原文
Qwen-Image-2.1 正式发布!开源越狱无审查,7B 参数媲美顶级闭源图片模型?本地部署实测!| 零度解说
介紹 Qwen-Image-2.1 的無審查越獄版,展示其僅 7B 參數即可媲美頂級閉源模型的圖片生成與編輯效果。透過 ComfyUI 進行本地部署實測,涵蓋從下載模型、安裝工作流到實際運作的完整步驟,並演示了多張參考圖的處理能力。
零度解说9 分鐘● 有原文
Goodbye Tokenmaxxing: From AI Usage to Agentic AI Outcomes
探討從單純追求 AI 使用量(Tokenmaxxing)或減少 Token 消耗(Token minimization)轉向重視實際業務成果(Valuemaxxing)的轉變。
IBM Technology8 分鐘● 有原文
上面沒列到的中文影片、Podcast 與文章
MiniMax H3 越狱拍大片!无审查生成长视频,支持剧情演绎、分镜控制!本地部署来了 | 零度解说
示範如何使用 Minimax H3 越獄模型與 Converse 客戶端,在本地部署生成帶劇情的長影片。觀眾可學習如何透過分鏡詞控制人物動作與鏡頭,並調整參數以最佳化輸出效果。
零度解说10 分鐘● 有原文
台大資訊 深度學習之應用 | ADL 6.6: Prompting Paradigm 基於提示的研究大補帖
介紹深度學習演進歷程,從傳統 supervised learning 到神經網路架構變化,再到預訓練語言模型與提示工程(Prompt Engineering)的興起。
陳縕儂 Vivian NTU MiuLab13 分鐘● 有原文
Qwen-Image-2.1 正式发布!开源越狱无审查,7B 参数媲美顶级闭源图片模型?本地部署实测!| 零度解说
介紹 Qwen-Image-2.1 的無審查越獄版,展示其僅 7B 參數即可媲美頂級閉源模型的圖片生成與編輯效果。透過 ComfyUI 進行本地部署實測,涵蓋從下載模型、安裝工作流到實際運作的完整步驟,並演示了多張參考圖的處理能力。
零度解说9 分鐘● 有原文
NTU/TAICA Machine Learning 2026 Fall Week 3
NTU/TAICA 機器學習 2026 秋季第 3 週課程影片,由林軒田講授。
Hsuan-Tien Lin3 小時 1 分○ 無原文
AI将会带来一场文艺复兴 | Demis Hassabis | DeepMind | AlphaFold | 人工智能 | AI革命 | AGI | 创造力 | 科学与艺术 | 神经科学 | 教育改革
DeepMind 創辦人戴密斯·哈薩比斯與數學家漢娜·弗萊探討 AI 如何引發新文藝復興,強調科學與藝術的交融。他認為 AI 將像工業革命般改變世界,並能加速醫學與科學發展,但需人類共同定義其價值與方向。
Best Partners TV24 分鐘● 有原文
內容最多的幾個主題,上面列過的不重複
Robot-Use Agents: Why General-Purpose Models May Win in Robotics
Y Combinator30 分鐘● 有原文
Goodbye Tokenmaxxing: From AI Usage to Agentic AI Outcomes
IBM Technology8 分鐘● 有原文
Fixing the PR Bottleneck — Matt Pocock, AIHero
AI Engineer23 分鐘● 有原文
Full Course: Spec-Driven Development with Coding Agents
DeepLearningAI1 小時 2 分● 有原文
Build & Sell with Codex (5+ Hour Course)
Nate Herk | AI Automation5 小時 11 分● 有原文
How To Use ChatGPT Work: The Complete Beginner's Guide (2026)
AI News & Strategy Daily | Nate B Jones1 小時 8 分● 有原文
Opus 5.5 Just Changed Video Editing Forever (free skills)
Nate Herk | AI Automation19 分鐘● 有原文
Using Claude Opus 5.5 as your daily driver
Claude4 分鐘● 有原文
Opus 5.5 正式发布!Claude 最新模型有多强?实测做动画、游戏、写代码,结果出乎意料! | 零度解说
零度解说11 分鐘● 有原文
Theo - t3․gg30 分鐘● 有原文
$30M Writer: Never write AI slop again
Greg Isenberg1 小時 10 分○ 無原文
Next-token prediction | AI Coding Dictionary
AI Hero(Matt Pocock)● 有原文
Take Upwork jobs, let AI do them (Astra etc). It's absurd.
Greg Isenberg48 分鐘● 有原文
Simon Willison's Weblog● 有原文
Matthew Berman7 分鐘○ 無原文
I Rebuilt This 46-Person Accounting Firm With AI (in 4 Days)
Liam Ottley18 分鐘○ 無原文
7 Ways How We Use AI Is Changing
The AI Daily Brief: Artificial Intelligence News23 分鐘● 有原文
JEV vs Thinking Models: 100% to 0%
Prompt Engineering11 分鐘○ 無原文