What's New in Inference Engineering — Philip Kiely, Baseten(在新分頁開啟原站)
Philip Kiely 介紹 Inference Engineering 的新發展,探討如何加速模型推理。
※ 摘要僅根據標題與說明
Inference & Serving ・ 40 筆內容
把模型變成穩定、便宜、夠快的服務。
也叫做:推論、推理部署、inference、model serving、vLLM、TGI、模型部署、latency、throughput、KV cache
依相關、人氣、新鮮度綜合排序;站長推薦的加成
Philip Kiely 介紹 Inference Engineering 的新發展,探討如何加速模型推理。
※ 摘要僅根據標題與說明
介紹了 FriendliAI 推出的 AI 推理雲端服務,讓開發者能輕鬆部署 Agent 應用。
※ 摘要僅根據標題與說明
Meta 的 Nishant Gupta 與 Naman Ahuja 探討如何在大規模下執行分散式推理系統。
※ 摘要僅根據標題與說明
介紹了如何將路徑模型(LLM)部署於生產環境,涵蓋從引擎訊號到策略的完整流程。
※ 摘要僅根據標題與說明
Philip Kiely 與 Ali Taha 探討 Baseten 公司如何將推理工程從邊緣概念轉為核心產業。他們指出,隨著模型規模擴大,推理不再是單純的後處理步驟,而是需要獨立最佳化策略的新領域。
※ 摘要僅根據標題與說明
探討 vLLM 模型推論中隱藏的兩個常見錯誤,並提供實戰解法,幫助工程師快速定位並修復問題。
※ 摘要僅根據標題與說明
本文解釋了 AI 模型推理(Inference)的運作機制:模型引數在訓練後固定,每次請求僅在給定的上下文中進行下一個詞預測。這使得推理成本與輸入輸出token數成正比,且無法像訓練時那樣從對話中學習修正錯誤。
本文解釋了 AI 開發中「模型提供者」的概念,即負責模型推理的遠端服務或本地工具。使用者需透過這些提供者獲取預判結果,並需了解其限額、價格與可用性。
這期內容涵蓋了作者從澳洲悉尼出發的旅行經歷、Ampl Labs 的成立動態,以及對軟體未來、AI 與機器學習的深入探討。文章探討了軟體開發的演變、AI 如何改變產品定義,並分享了關於機器學習模型、Agentic Inference(代理推…
CoreWeave 的科瑞·桑德斯與 Chris 討論了 AI 基礎設施如何從傳統雲端演變為專為 AI 設計的架構。他們指出,隨著 AI 應用複雜度提升,需要全新的訓練與推理工作流,特別強調「代理開發」與 AI 原生基礎設施的重要性。
這篇影片介紹了如何透過外部知識增強大語言模型的推理能力,並提供了一個全面的調查報告,幫助讀者理解相關技術。
※ 摘要僅根據標題與說明
依發布時間
介紹了 Olmo-core 3,這是 Hugging Face 推出的大型混合專家(MoE)訓練架構升級版。它旨在將訓練規模擴充套件至十億引數級別,同時保持計算效率。
台灣企業推動 AI 意願高,但僅 35% 正式匯入 Kubernetes,多數仍依賴虛擬化環境,面臨維運成本雙重負擔。Nutanix 透過單一平台策略協助企業平滑過渡,並推出支援開源的 NKP 方案,讓企業能將核心應用搬上容器化架構,提升…
探討了 Jev 模型,它是一種基於 TypeSafe 架構的決策引擎,而非傳統聊天機器人。John Lindquist 展示了 Jev 在實時語音待辦事項分類、資料去重、遊戲路徑規劃以及瀏覽器互動等多個場景中的應用。
NVIDIA Kumo Tabular 是一款開源表格基礎模型,能在單次前向推論中直接預測新資料標籤,無需訓練或特徵工程。它基於表格結構設計,支援分類與回歸,並率先在 TabArena 等四個指標中取得最佳成績。
探討了 AI 領域的潛在空間(Latent Space)如何演變,涵蓋了從模型效能評估到新型推理框架如 JEV 的技術發展。
LFM2.5-VL-DSpark 是一款專為加速視覺語言模型推理設計的擴充模型,僅增加 8.9% 引數即可提升 2.6 倍至 3.1 倍的推理速度。該模型支援 Llama.cpp、MLX-VLM 及 SGLang 等工具,並提供即時支援。
本文解釋了 AI 開發中「模型提供者」的概念,即負責模型推理的遠端服務或本地工具。使用者需透過這些提供者獲取預判結果,並需了解其限額、價格與可用性。
本文解釋了 AI 模型推理(Inference)的運作機制:模型引數在訓練後固定,每次請求僅在給定的上下文中進行下一個詞預測。這使得推理成本與輸入輸出token數成正比,且無法像訓練時那樣從對話中學習修正錯誤。
探討 vLLM 模型推論中隱藏的兩個常見錯誤,並提供實戰解法,幫助工程師快速定位並修復問題。
※ 摘要僅根據標題與說明
介紹了 FriendliAI 推出的 AI 推理雲端服務,讓開發者能輕鬆部署 Agent 應用。
※ 摘要僅根據標題與說明
Philip Kiely 介紹 Inference Engineering 的新發展,探討如何加速模型推理。
※ 摘要僅根據標題與說明
介紹了從 MVP 到萬億引數級工作量的垂直移動策略,核心 Weave 團隊分享了具體方法。
※ 摘要僅根據標題與說明