聽節目(在新分頁開啟原站)連到 Latent Space
摘要
探討推理工程(Inference Engineering)如何從單純的模型訓練後處理,轉變為獨立的工程領域。講者Philip Kiely與Ali Taha解釋了長查詢處理、Speculative Decoding、工具呼叫最佳化及KV Cache 壓縮等關鍵技術。他們指出,隨著模型規模擴大,推理不再是訓練的附屬品,而是需要獨立研究與架構設計的核心環節。
This interview explores how inference engineering has evolved from post-training processing into a distinct engineering discipline. Speakers Philip Kiely and Ali Taha explain techniques for handling long queries, speculative decoding, tool calling optimization, and KV cache compression. They note as…
重點
- 長查詢處理需透過分割槽與預編碼來加速,避免全量預編。
- Speculative Decoding 透過小模型預測多輪再驗證,大幅提升吞吐量。
- 工具呼叫需透過狀態機結構化輸出來避免模型誤判。KV Cache 壓縮可實現持續學習。
章節
依話題轉折切分,標題由 AI 產生
- 00:00內部傳承:如何從 Base Ten 選拔新的內部員工
- 05:59工具呼叫挑戰:如何確保模型在特定格式下正確執行操作
- 11:03模型發布後的工程工作:從 GLM 到 Kimi 的差異
- 19:31注意力機制最佳化:如何將其他模型的層級無縫整合
- 24:55量化與精確度平衡:量化標準與損失函式的考量
- 32:12影響工程的速度提升:金融領域的基點點數最佳化
- 42:23模型分散化:從 Medusa 到 NVM 的技術演進
- 46:02本地 AI 與資料中心的差異:MacBook 上的 Gemma 部署
- 49:43張量分佈與專家分佈:跨 GPU 推理的架構選擇
- 1:12:51影片生成與 LLM 的規模差距:超引數模型的開源趨勢
- 1:27:25推理與訓練的交叉:動態調整系統以加速滾出
- 1:33:28系統級整合:多模型協同處理的未來挑戰
- 1:36:54持續學習的推理工程:KV 壓縮與知識更新
- 1:40:41內部員工招募:如何從全球頂尖學府選拔人才
提到的工具與公司
- KV Cache Compaction
適合誰看
AI 工程師、系統架構師、模型部署開發者。
摘要依據
- 講者
- Philip Kiely、Ali Taha、Alessio Fanelli
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.80
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- What's New in Inference Engineering — Philip Kiely, Baseten影片 ・ AI Engineer ・ 19 分鐘(在新分頁開啟原站)
- How to Engineer AI Inference Systems with Philip Kiely - #766Podcast ・ The TWIML AI Podcast ・ 55 分鐘(在新分頁開啟原站)
- 加快語言模型生成速度 (2/2):KV Cache影片 ・ Hung-yi Lee ・ 39 分鐘(在新分頁開啟原站)
- Large Transformer Model Inference Optimization文章 ・ Lilian Weng(部落格)
- The CEO Behind the Fastest-Growing AI Inference Company | Tuhin SrivastavaPodcast ・ Gradient Dissent ・ 59 分鐘(在新分頁開啟原站)
- Build A Reasoning Model From Scratch 2: Loading a Base Model, Text Generation, and KV Caching影片 ・ Sebastian Raschka ・ 1 小時 37 分(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
