跳到主要內容
AI 武林

vLLM

45 筆內容提到

最近 7 天 5 筆新上榜(前一期沒有,這一期新出現)(再前 7 天 0 筆)

也寫作:VLLM

這一頁列的是「提到 vLLM」的內容(名稱由語言模型從內容裡整理),不一定整筆都在講它。只想追它的新內容:訂閱 RSS;想找標題裡就有它的:搜尋「vLLM」。

最新

依發布時間,最新的 30 筆

  1. 影片AI Engineer進階EN

    What Is an Inference Engine, Anyway? — Charles Frye, Modal

    Charles Frye 解析推理引擎如何處理從 API 請求到模型輸出的完整流程,涵蓋分詞、排程與 GPU 執行等關鍵環節。影片說明不同工作負載(如聊天機器人、背景代理)對延遲與吞吐量的影響,並探討 KV 快取與推測解碼等最佳化技術。

    4,817次觀看

    ※ 摘要僅根據標題與說明

  2. 影片AI Engineer高階EN

    The Frontier AI Inference Cloud for Agents — Byung-Gon (Gon) Chun, FriendliAI

    探討代理推理與聊天不同的架構需求,強調以任務完成時間為指標。透過開源模型與閉源模型比較,展示開源模型能以極低成本達成可用品質。FriendliAI 透過字首快取、分層 KV 快取管理、感知快取的路由及感知代理的排程,最佳化任務端到端延遲。

    1.7 萬次觀看
  3. 文章AINews(Latent Space/smol.ai)入門EN

    OpenAI reports Navier-Stokes singularity find, a contender for second ever Millenium Prize awarded, overshadowing Cognition's $48B Series E, Mistral's $24B Series D, Meta's Muse agent, and GPT Image 2.5

    OpenAI 宣佈內部模型利用 10,000 個代理在 88 小時內完成納維 - 斯托克斯方程的證明,挑戰百萬美元獎金,引發對測試時間運算規模的討論。

最受歡迎

依人氣

  1. 4影片AI Engineer進階EN

    What Is an Inference Engine, Anyway? — Charles Frye, Modal

    Charles Frye 解析推理引擎如何處理從 API 請求到模型輸出的完整流程,涵蓋分詞、排程與 GPU 執行等關鍵環節。影片說明不同工作負載(如聊天機器人、背景代理)對延遲與吞吐量的影響,並探討 KV 快取與推測解碼等最佳化技術。

    4,817次觀看

    ※ 摘要僅根據標題與說明

  2. 6影片AI Engineer高階EN

    The Frontier AI Inference Cloud for Agents — Byung-Gon (Gon) Chun, FriendliAI

    探討代理推理與聊天不同的架構需求,強調以任務完成時間為指標。透過開源模型與閉源模型比較,展示開源模型能以極低成本達成可用品質。FriendliAI 透過字首快取、分層 KV 快取管理、感知快取的路由及感知代理的排程,最佳化任務端到端延遲。

    1.7 萬次觀看