跳到主要內容
AI 武林
Podcast高階EN

The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten

來源 Latent Space

聽節目(在新分頁開啟原站)連到 Latent Space

摘要

探討推理工程(Inference Engineering)如何從單純的模型訓練後處理,轉變為獨立的工程領域。講者Philip Kiely與Ali Taha解釋了長查詢處理、Speculative Decoding、工具呼叫最佳化及KV Cache 壓縮等關鍵技術。他們指出,隨著模型規模擴大,推理不再是訓練的附屬品,而是需要獨立研究與架構設計的核心環節。

This interview explores how inference engineering has evolved from post-training processing into a distinct engineering discipline. Speakers Philip Kiely and Ali Taha explain techniques for handling long queries, speculative decoding, tool calling optimization, and KV cache compression. They note as…

重點

  • 長查詢處理需透過分割槽與預編碼來加速,避免全量預編。
  • Speculative Decoding 透過小模型預測多輪再驗證,大幅提升吞吐量。
  • 工具呼叫需透過狀態機結構化輸出來避免模型誤判。KV Cache 壓縮可實現持續學習。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00內部傳承:如何從 Base Ten 選拔新的內部員工
  2. 05:59工具呼叫挑戰:如何確保模型在特定格式下正確執行操作
  3. 11:03模型發布後的工程工作:從 GLM 到 Kimi 的差異
  4. 19:31注意力機制最佳化:如何將其他模型的層級無縫整合
  5. 24:55量化與精確度平衡:量化標準與損失函式的考量
  6. 32:12影響工程的速度提升:金融領域的基點點數最佳化
  7. 42:23模型分散化:從 Medusa 到 NVM 的技術演進
  8. 46:02本地 AI 與資料中心的差異:MacBook 上的 Gemma 部署
  9. 49:43張量分佈與專家分佈:跨 GPU 推理的架構選擇
  10. 1:12:51影片生成與 LLM 的規模差距:超引數模型的開源趨勢
  11. 1:27:25推理與訓練的交叉:動態調整系統以加速滾出
  12. 1:33:28系統級整合:多模型協同處理的未來挑戰
  13. 1:36:54持續學習的推理工程:KV 壓縮與知識更新
  14. 1:40:41內部員工招募:如何從全球頂尖學府選拔人才

提到的工具與公司

  • KV Cache Compaction

適合誰看

AI 工程師、系統架構師、模型部署開發者。

摘要依據

講者
Philip Kiely、Ali Taha、Alessio Fanelli
依據
語音轉文字

為什麼排在這裡

人氣
0.50
新鮮
0.80

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)