影片高階EN12.9 萬 次觀看
Stanford CS25: Transformers United V6 I From Language Models to Native Multimodal Intelligence
看影片(在新分頁開啟原站)連到 Stanford Online
摘要
由 Victoria Lin 主講,探討從語言模型演進至原生多模態智慧的架構與訓練原則。內容涵蓋多模態模型的建築塊、自回歸建模方式,以及 Omni 模型如何整合理解與生成能力,並分析其在機器人與空間推理上的應用前景。
A seminar discussing the evolution from language models to native multimodal systems, covering architecture, training principles, and the capabilities of Omni models.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 原生多模態模型透過統一分詞機制,將影像、音訊轉為序列處理。
- Omni 模型能同時處理多模態輸入與輸出,整合理解與生成能力。
- 語言模型架構可轉移至多模態領域,提升規劃、推理與擴展效能。
章節
依話題轉折切分,標題由 AI 產生
- 00:05歡迎 Victoria Lin 分享原生多模態智慧
- 04:34將影像與聲音轉化為 Token 處理
- 08:44大語言模型架構可轉移至多模態
- 11:41Chameleon 系列嘗試統一 Token 化
- 20:50混合 Transformer 架構提升效率
- 23:48實驗顯示混合架構在生成任務優勢
- 38:11多模態模型仍面臨物理世界挑戰
- 41:08多模態處理是未來機器人與物理智慧的關鍵
- 45:48問答探討不同模態間資訊傳遞與條件化機制
- 48:55質疑多模態訓練能否有效轉移到一般知識工作
- 52:53討論將文字轉為影像貼片以統一模態的可行性
- 55:57探討單一表示能否同時涵蓋感知、生成與推理
- 58:54分析自回歸預測在認知層次上的侷限與爭議
- 1:03:16確認語言作為骨架對視覺推理效率的顯著幫助
提到的工具與公司
- Patchify
- Chameleon
- BAGEL
- MoT
適合誰看
適合對多模態大語言模型架構、訓練原理及未來發展方向感興趣的研究者與開發者。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.79
- 新鮮
- 0.63
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 17: Alignment - Multimodality影片 ・ Stanford Online ・ 1 小時 18 分(在新分頁開啟原站)
- Stanford CME295 Transformers & LLMs | Autumn 2026 | Lecture 1 - Transformers影片 ・ Stanford Online ・ 1 小時 44 分(在新分頁開啟原站)
- Coding a Multimodal (Vision) Language Model from scratch in PyTorch with full explanation影片 ・ Umar Jamil ・ 5 小時 46 分(在新分頁開啟原站)
- MIT 6.S191 (2025): Large Language Models (Google)影片 ・ Alexander Amini ・ 56 分鐘(在新分頁開啟原站)
- LLM Lecture: A Deep Dive into Transformers, Prompts, and Human Feedback影片 ・ AI Coffee Break with Letitia ・ 1 小時 31 分(在新分頁開啟原站)
- Decoding Google Gemini with Jeff DeanPodcast ・ Google DeepMind: The Podcast ・ 53 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
