跳到主要內容
AI 武林
影片高階EN7,712 次觀看

Autoresearch Made Our Models 3x Faster — Tejas Bhakta, Morph

來源 AI Engineer

看影片(在新分頁開啟原站)連到 AI Engineer

其他版本:AIE Talks 摘要頁(在新分頁開啟)

摘要

介紹 Morph 如何利用自動研究框架最佳化 GPU 核心,將模型速度提升三倍。人類負責提出高階最佳化概念,代理則負責調整參數並驗證正確性與速度。內容涵蓋使用 NSight 進行效能分析、針對便宜 GPU 自訂核心、避免獎勵欺騙以及硬體層面的最佳化技巧。

Tejas Bhakta explains how Morph uses an agent framework to optimize GPU kernels and achieve three times faster model inference.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 人類提供高階最佳化概念,代理負責調整參數。
  • 使用 NSight 分析效能瓶頸並避免獎勵欺騙。
  • 結合自訂核心與硬體最佳化可達三倍速度提升。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00Intro
  2. 00:32What is autoresearch?
  3. 01:02Why GPU kernels fit autoresearch
  4. 01:32Humans bring the ideas
  5. 02:17Compute, memory and overhead bottlenecks
  6. 03:02Cheap GPUs need custom kernels
  7. 03:17Give the agent hardware context
  8. 03:52Give the agent model context
  9. 04:12Reward hacking
  10. 05:16Custom kernels aren't faster everywhere
  11. 05:36Kernel gains compound
  12. 06:01Bare-metal hacks
  13. 06:363x faster, but 80% of attempts are bad
  14. 06:57TL;DR

提到的工具與公司

  • Morph
  • NSight
  • CUDA
  • DeepSeek
  • B200
  • H200
  • NVLink

適合誰看

從事大模型推理最佳化、GPU 效能調校或開發自訂核心的工程師。

摘要依據

講者
Tejas Bhakta
依據
自動字幕

為什麼排在這裡

人氣
0.74
新鮮
0.97

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)