LLM加速及快取管理平臺LMCache多行程模式曝重大RCE漏洞
JFrog 揭露大型語言模型推論加速平台 LMCache 存在嚴重遠端程式碼執行漏洞,CVSS 評分達 9.8。該漏洞出現在多行程模式的 ZeroMQ 服務,因缺乏身分驗證且直接還原 Python 物件,讓攻擊者無需登入即可執行任意程式碼。
依發布時間,最新的 30 筆
JFrog 揭露大型語言模型推論加速平台 LMCache 存在嚴重遠端程式碼執行漏洞,CVSS 評分達 9.8。該漏洞出現在多行程模式的 ZeroMQ 服務,因缺乏身分驗證且直接還原 Python 物件,讓攻擊者無需登入即可執行任意程式碼。
Sheilah Kirui 介紹 Speculative Decoding 技術,利用小模型預測多個 token 供大模型驗證以加速推理。
※ 摘要僅根據標題與說明
Charles Frye 解析推理引擎如何處理從 API 請求到模型輸出的完整流程,涵蓋分詞、排程與 GPU 執行等關鍵環節。影片說明不同工作負載(如聊天機器人、背景代理)對延遲與吞吐量的影響,並探討 KV 快取與推測解碼等最佳化技術。
※ 摘要僅根據標題與說明
Pillar Security 揭露 Unsloth Studio 存在任意程式碼執行漏洞,檢查模型資訊時即可觸發。問題源於預設啟用 trust_remote_code,攻擊者可透過自訂模型儲存庫注入惡意程式碼。
Bogdan Gaza 分享 DatologyAI 如何透過「種子重寫」技術,將合成資料規模從 300 億擴展至約 1200 億 token。
※ 摘要僅根據標題與說明
收錄 AI Engineer Paris 2026 第二天的主舞台演講,涵蓋從模型自訂到邊緣 AI 的實作經驗。觀眾可從 Google DeepMind、ElevenLabs 等講者處學習生產級 AI 系統的架構與最佳化技巧。
※ 摘要僅根據標題與說明
AMD 軟體主管 Anush Elangovan 訪談中,介紹 ROCm 如何透過開放原始碼與 AI 代理技術,大幅降低 GPU 程式設計門檻。內容涵蓋 ROCm 架構、SIMT 平行計算原理,以及 AI 如何協助最佳化硬體程式碼與效能。
探討代理推理與聊天不同的架構需求,強調以任務完成時間為指標。透過開源模型與閉源模型比較,展示開源模型能以極低成本達成可用品質。FriendliAI 透過字首快取、分層 KV 快取管理、感知快取的路由及感知代理的排程,最佳化任務端到端延遲。
Daniel Svonava 分享如何讓小型開源模型在生產環境中發揮 frontier 級效能,透過任務分割與專用模型組合降低成本。
Asaf Gardin 與 Yuval Belfer 分享在 vLLM 部署 AI21 Jamba 模型時發現的兩個隱性錯誤。第一個導致偶爾輸出無意義內容,根源在於解碼階段早於預填充階段執行;第二個則由 32 位索引溢位引發。
訪談 Inception 創辦人 Stefano Ermon,探討他如何將擴散模型應用於文字與程式碼生成,並解釋為何擴散架構在推理速度上優於自迴歸模型。內容涵蓋從學術研究到商業化部署的經驗,以及未來 AI 競爭將由效率決定的觀點。
探討代理型 AI 如何改變推理工作負載,指出傳統 GPU 在生成階段面臨記憶體瓶頸。SambaNova 的 RDU 架構將整個模型空間化佈局,實現線性擴展與高並行,解決速度與吞吐量取捨問題,並可部署於既有資料中心。
DeepSeek 推出 V4.1-Flash,採用新型因果編碼器 - 解碼器架構,大幅降低推理成本與記憶體佔用,在人工分析指數上獲 40 分,表現優於前代且僅次於 GLM-5.3-Flash。
介紹如何利用 Hugging Face Jobs 與 Storage Bucket,搭配 AsyncGRPOTrainer 與 LoRA,實現訓練與推論分離的加速方案。
AMD 企業 VP Anush Elangovan 分享 ROCm 10 如何透過 AI Agent 自動安裝、除錯與最佳化 GPU 工作負載。
OpenAI 宣佈內部模型利用 10,000 個代理在 88 小時內完成納維 - 斯托克斯方程的證明,挑戰百萬美元獎金,引發對測試時間運算規模的討論。
拆解阿里 Qwen3.8-Flash 與智譜 GLM-5.3-Flash 如何在 DeepSeek 漲價後,透過混合注意力、門控殘差及 N-gram 嵌入等架構創新大幅降低訓練與推理成本。
整理 2026 年 8 月 AI 領域動態,涵蓋 Z.ai GLM-5.3、Tencent Hy4 與 Qwen3.8 Flash 等開源模型發布,以及 vLLM 推導解碼、搜尋系統與智慧體效能評估等系統層面進展。
彙整了 2026 年 8 月下旬 AI 領域的動態,重點介紹了 Pollen Robotics 與 Hugging Face 合作推出的 $399 開源雙足機器人 Microduck,以及 Z.ai 揭曉的 GLM-5.3-Flash 大…
※ 摘要僅根據標題與說明
Granite 4.2 系列是 IBM 推出的三檔(3B、8B、30B)推理型大型語言模型,透過多階段強化學習與工具呼叫訓練,具備思考/不思考模式切換能力。
Podcast 訪談 LinkedIn 資深 AI 研究員 Praveen Bodigutla,介紹其團隊為招聘助手開發的認知記憶代理系統。
彙整了 AI 領域的最新動態,涵蓋 NVIDIA 提出的「Skill Lift」評估指標、Headlong 與 exo 等持久化代理架構、Anthropic 的企業 MCP 聯結器,以及 Qwen3.8-27B 等模型的表現。
介紹 Ornith-1.5 新模型家族、壓縮技術突破與 Agent 運算架構演進,涵蓋 Qwen3.8、DeepSeek Harness 與 TrueForge 等工具。讀者可掌握最新開源模型規格、效能比較與部署策略。
彙整了 2026 年 8 月 AI 領域的最新動態,重點涵蓋 Z.ai 推出 GLM-5.3、Alibaba 發布 Qwen3.8-27B 以及 DeepSeek V4-Pro 的更新。
Meta 推出 Muse Glimmer,一款 30B 參數的多模態開源模型,支援圖片、影片與程式碼處理,並提供本地部署與推論加速方案。
Meta 推出 Muse Glimmer 30B 開源多模態代理模型,支援本地部署與量化加速;同時 Anthropic 的 Claude 變體在黎曼猜想研究中提升下界,OpenAI 則發布 GPT-5.6-Cyber 專注網路安全。
探討 vLLM 如何從研究專案演變為關鍵基礎設施,並由 Simon Mo 與 Matt Bornstein 分析開源 AI 的經濟模式與未來。內容涵蓋開權重模型的興起、企業轉向開源的原因、模型授權機制,以及開源與閉源模型能力的差距縮小趨勢。
彙整了 2026 年 7 月底 AI 領域動態,涵蓋 OpenAI 代理安全事件、GPT-5.6 效能最佳化、Kimi K3 模型細節及學術資源開放等議題。讀者可了解最新模型表現、安全治理爭議及開發工具更新。
訪談遊凱超分享 vLLM 如何從校園專案演變為獲 1.5 億美元融資的創業公司,並探討 AI 基礎設施的多方協同設計。
※ 摘要僅根據標題與說明
依人氣
※ 摘要僅根據標題與說明
Bogdan Gaza 分享 DatologyAI 如何透過「種子重寫」技術,將合成資料規模從 300 億擴展至約 1200 億 token。
※ 摘要僅根據標題與說明
Sheilah Kirui 介紹 Speculative Decoding 技術,利用小模型預測多個 token 供大模型驗證以加速推理。
※ 摘要僅根據標題與說明
Charles Frye 解析推理引擎如何處理從 API 請求到模型輸出的完整流程,涵蓋分詞、排程與 GPU 執行等關鍵環節。影片說明不同工作負載(如聊天機器人、背景代理)對延遲與吞吐量的影響,並探討 KV 快取與推測解碼等最佳化技術。
※ 摘要僅根據標題與說明
收錄 AI Engineer Paris 2026 第二天的主舞台演講,涵蓋從模型自訂到邊緣 AI 的實作經驗。觀眾可從 Google DeepMind、ElevenLabs 等講者處學習生產級 AI 系統的架構與最佳化技巧。
※ 摘要僅根據標題與說明
探討代理推理與聊天不同的架構需求,強調以任務完成時間為指標。透過開源模型與閉源模型比較,展示開源模型能以極低成本達成可用品質。FriendliAI 透過字首快取、分層 KV 快取管理、感知快取的路由及感知代理的排程,最佳化任務端到端延遲。
探討 vLLM 如何從研究專案演變為關鍵基礎設施,並由 Simon Mo 與 Matt Bornstein 分析開源 AI 的經濟模式與未來。內容涵蓋開權重模型的興起、企業轉向開源的原因、模型授權機制,以及開源與閉源模型能力的差距縮小趨勢。
Daniel Svonava 分享如何讓小型開源模型在生產環境中發揮 frontier 級效能,透過任務分割與專用模型組合降低成本。
Asaf Gardin 與 Yuval Belfer 分享在 vLLM 部署 AI21 Jamba 模型時發現的兩個隱性錯誤。第一個導致偶爾輸出無意義內容,根源在於解碼階段早於預填充階段執行;第二個則由 32 位索引溢位引發。
介紹 Ornith 1.0 系列自架構編碼模型,能自動設計並執行任務指令碼。觀眾可學習模型如何利用強化學習訓練「自支撐」能力,以及如何在本地環境執行不同規模模型。