跳到主要內容
AI 武林
Podcast進階EN

How Physical AI Learns Across Language, Video and Action — Ming-Yu Liu

來源 Machine Learning Street Talk

聽節目(在新分頁開啟原站)連到 Machine Learning Street Talk

摘要

Ming-Yu Liu 解釋 NVIDIA Cosmos 模型如何將語言、影片、聲音與動作整合,透過自動迴歸與擴散生成器,讓單一模型同時處理多模態資料。該模型透過共享時序位置方案,將不同頻率的訊號統一,並結合前向、逆向動力學與策略,實現跨模態的協同學習。

Ming-Yu Liu explains how NVIDIA's Cosmos model integrates language, video, audio, and actions through an auto-regressive and diffusion generator, enabling a single model to handle multimodal data. The model uses a shared temporal position scheme to unify signals of different frequencies, combining a…

重點

  • Cosmos 模型整合語言、影片、聲音與動作,透過自動迴歸與擴散生成器處理多模態資料。
  • 模型使用共享時序位置方案統一不同頻率的訊號,並結合前向、逆向動力學與策略進行協同學習。
  • Cosmos 模型可將測試結果從模擬器直接轉化為真實環境驗證,加速開發速度。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00Nvidia Cosmos 3 模擬未拍攝道路
  2. 09:14跨具身模擬的視覺與動作共現
  3. 12:17系統層級下的物理任務訓練
  4. 17:03邊界案例與政策改進
  5. 19:50因果模型與多具身適應
  6. 24:36開放資源與開發者支援

提到的工具與公司

  • Cosmos
  • DROID dataset
  • Hugging Face

適合誰看

AI 研究者、機器人開發者、模擬器工程師或對多模態學習感興趣的技術人員。

摘要依據

講者
Ming-Yu Liu、Tim Scarfe
依據
語音轉文字

為什麼排在這裡

人氣
0.50
新鮮
0.94

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)