Podcast進階EN
How Physical AI Learns Across Language, Video and Action — Ming-Yu Liu
聽節目(在新分頁開啟原站)連到 Machine Learning Street Talk
摘要
Ming-Yu Liu 解釋 NVIDIA Cosmos 模型如何將語言、影片、聲音與動作整合,透過自動迴歸與擴散生成器,讓單一模型同時處理多模態資料。該模型透過共享時序位置方案,將不同頻率的訊號統一,並結合前向、逆向動力學與策略,實現跨模態的協同學習。
Ming-Yu Liu explains how NVIDIA's Cosmos model integrates language, video, audio, and actions through an auto-regressive and diffusion generator, enabling a single model to handle multimodal data. The model uses a shared temporal position scheme to unify signals of different frequencies, combining a…
重點
- Cosmos 模型整合語言、影片、聲音與動作,透過自動迴歸與擴散生成器處理多模態資料。
- 模型使用共享時序位置方案統一不同頻率的訊號,並結合前向、逆向動力學與策略進行協同學習。
- Cosmos 模型可將測試結果從模擬器直接轉化為真實環境驗證,加速開發速度。
章節
依話題轉折切分,標題由 AI 產生
- 00:00Nvidia Cosmos 3 模擬未拍攝道路
- 09:14跨具身模擬的視覺與動作共現
- 12:17系統層級下的物理任務訓練
- 17:03邊界案例與政策改進
- 19:50因果模型與多具身適應
- 24:36開放資源與開發者支援
提到的工具與公司
- Cosmos
- DROID dataset
- Hugging Face
適合誰看
AI 研究者、機器人開發者、模擬器工程師或對多模態學習感興趣的技術人員。
摘要依據
- 講者
- Ming-Yu Liu、Tim Scarfe
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.94
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Open models and the future of Physical AI with NVIDIAPodcast ・ Practical AI ・ 47 分鐘
- When Will AI Make Me Scrambled Eggs? I Went To NVIDIA To Find Out.影片 ・ AI News & Strategy Daily | Nate B Jones ・ 46 分鐘(在新分頁開啟原站)
- Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 17: Alignment - Multimodality影片 ・ Stanford Online ・ 1 小時 18 分(在新分頁開啟原站)
- Multimodality and Large Multimodal Models (LMMs)文章 ・ Chip Huyen(部落格)
- NeoMME: an efficient Multimodal-native and Multilingual Encoder文章 ・ Hugging Face Blog
- Build Visual AI Agents From a Prompt With NVIDIA Cosmos and VSS 3.3影片 ・ NVIDIA Developer(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
