聽節目(在新分頁開啟原站)連到 Latent Space
摘要
Ethan He 分享了他在 xAI 與 Grok Imagine 的經驗,指出未來真正的 AI 突破將從單純的影片生成模型轉向具備規劃、編輯、自我演進能力的「影片代理」。他強調,要實現長時程互動,必須解決上下文壓縮、即時響應速度及長期記憶等挑戰,並提出透過影片擴展技術讓模型能修改自身指令以適應新任務。
Ethan He shares his experience at xAI and Grok Imagine, highlighting the shift from video generation models to AI agents capable of planning, editing, and self-evolution. He emphasizes solving challenges like context compression, real-time responsiveness, and long-term memory to achieve interactive…
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- Ethan He 在 xAI 與 Grok Imagine 工作,專注於影片代理與互動模型。
- 未來 AI 突破將從影片生成轉向具備規劃與自我演進能力的系統。
- 實現長時程互動需解決上下文壓縮、即時響應及長期記憶等挑戰。
章節
依話題轉折切分,標題由 AI 產生
- 00:00Ethan 與 Vibhu 的相遇:從 Nvidia 的 Cosmos 到 xG
- 04:18AI 訓練的效能瓶頸:迭代次數與基礎設施的關鍵
- 10:09從影像生成到音訊合成:Cosmos 的標準化流程
- 22:23網頁瀏覽器般的互動體驗:生成式 UI 的實例
- 32:38影片模型的成本分析:GPU 時數與儲存需求
- 37:15推理端的最佳化:模型溶解與步數削減
- 41:40多模態融合的挑戰:文字、音訊與音樂的難題
- 46:30LLMs 缺乏時間感知導致任務延遲
- 57:55參考影片功能解決長影片重複問題
- 1:05:13將世界模型與影片生成結合
- 1:09:36多工具組合提升產出品質
- 1:33:48語言模型具備上下文感知能力
- 1:38:36從計算密集型轉向參數規模化
- 1:42:03Megatron MoEs 架構最佳化
提到的工具與公司
- Cosmos
- Grok Imagine
- OpenCL
- Py
- Colossus
適合誰看
對 AI 代理、影片生成、長時程互動及系統架構感興趣的開發者與研究者。
摘要依據
- 講者
- Ethan He、Alessio Fanelli
- 依據
- 語音轉文字
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.62
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Coding Agents Are Secretly General Agents影片 ・ AAIF Live ・ 1 小時 12 分
- E223|应用爆发之年:聊聊模型技术进化与商业化Podcast ・ 硅谷101 ・ 1 小時 7 分
- Amazon Ban Hammer, Seedance Strategy, Amazon Blocks Muse | Vinod Khosla, Augustus Doricko, Ben Hylak, Aaron Levie, Lucas ShawPodcast ・ TBPN ・ 2 小時 51 分
- Agents, RAG, and Reasoning Models影片 ・ Luis Serrano Academy ・ 27 分鐘(在新分頁開啟原站)
- OpenAI just crossed a THRESHOLD...影片 ・ Wes Roth ・ 29 分鐘(在新分頁開啟原站)
- Agentic video understanding in Gemini影片 ・ Google for Developers ・ 3 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)
