聽節目(在新分頁開啟原站)連到 卫诗婕|漫谈 Light the Star
摘要
訪談邀請了智象未來創始人梅濤院士,深入探討從圖片到影片、再到世界模型的技術演進路徑。梅濤分享了他團隊如何從圖片模型切入,利用龐大資料量構建影片生成模型,並展望未來語言、影片與具身智慧將匯聚成世界模型的終局。內容涵蓋了多模態架構的差異、創業公司的敏捷優勢以及對產業趨勢的深刻洞察。
An interview with academician Mei Tao discussing the evolution from image to video models and the future of world models in AI.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 圖片是通往多模態與世界模型的關鍵入口。
- 創業公司應追求技術敏捷與決策速度,而非依賴資源堆疊。
- 未來趨勢是語言、影片與具身智慧匯聚成世界模型。
章節
依話題轉折切分,標題由 AI 產生
- 00:00全球首篇紋身影片論文與資料規模
- 07:52院士創業全情投入與中科大背景
- 16:36科大學術氛圍對科研規劃的塑造
- 40:27AI Agent 迭代速度超越網際網路程序
- 52:51創業公司架構創新對抗大廠算力
- 1:01:51開源模型短期優勢與持續迭代策略
- 1:07:43第一方陣競爭與世界模型路線分歧
- 1:47:59太空歌劇院圖片引發 AIGC 熱潮
- 1:50:54視覺理解與生成模型架構仍分途
- 1:55:12尋找中國 Sora 背後投資邏輯
- 2:14:39矽谷精神與員工以個人為先
- 2:49:14深創投背書看好多模態賽道
- 2:55:06閉環資料增廣解決具身訓練難
- 3:07:27頂尖人才與通用審美驅動未來
提到的工具與公司
- Gemini Omni
- Sora
- Veo 3
- DIT
- HiDream
適合誰看
適合對多模態大模型、影片生成技術及 AI 產業趨勢感興趣的開發者、產品經理與投資人。
摘要依據
- 講者
- 卫诗婕
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.35
- 新鮮
- 0.76
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Moonlake: Causal World Models should be Multimodal, Interactive, and Efficient — with Chris Manning and Fan-yun SunPodcast ・ Latent Space ・ 1 小時 7 分
- Why Video Agent models are next — Ethan He, xAI Grok ImaginePodcast ・ Latent Space ・ 1 小時 43 分
- A 7-hour marathon interview with Saining Xie: World Models, AMI Labs, Yann LeCun, Fei-Fei Li, and 42影片 ・ Zhang Xiaojun Podcast ・ 6 小時 45 分(在新分頁開啟原站)
- E223|应用爆发之年:聊聊模型技术进化与商业化Podcast ・ 硅谷101 ・ 1 小時 7 分
- World Models, Robotics, and the Future of 3D AIPodcast ・ The a16z Show ・ 24 分鐘(在新分頁開啟原站)
- 李飞飞发布最新世界模型Atlas | World Labs | 世界模型 | 3D重建 | 视频生成 | 空间智能 | 高斯泼溅 | 机器人仿真 | 多模态AI影片 ・ Best Partners TV ・ 21 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
