影片進階EN9,815 次觀看
Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 17: Alignment - Multimodality
看影片(在新分頁開啟原站)連到 Stanford Online
摘要
介紹多模態模型如何將圖片、音訊等非文字資料轉換為 transformer 可處理的 token,並探討 CLIP、LLaVA 等架構的運作原理與資料處理策略。看完後能理解多模態系統如何整合不同感官輸入,以及面對高解析度與長上下文時的技術挑戰。
This lecture explains how multimodal models convert images and audio into tokens for transformers, covering CLIP, LLaVA, and training challenges like loss instability.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 多模態模型需將圖片、音訊等非文字資料轉化為 token 才能輸入 transformer。
- CLIP 透過對比學習建立圖片與文字的高層級語義對齊,LLaVA 則升級為處理多張圖與影片。
- 直接將多模態混合訓練會導致損失不穩定,需透過特定正規化或分階段訓練來解決。
章節
依話題轉折切分,標題由 AI 產生
- 00:05課程調整:從強化學習轉向多模態概覽
- 04:28CLIP 原理:利用網路資料進行語意對齊
- 09:45視覺編碼器:影像尺寸處理與 ResNet 演算法
- 11:46視覺 Transformer:Patch 分割與注意力池化機制
- 16:57訓練策略:跨熵損失與零樣本分類優勢
- 21:53SigLIP 架構:簡化二分類與大批次需求挑戰
- 25:14效率最佳化:SigLIP 的並行訓練與硬體加速
- 28:44LLaVA 與 Qwen 多模態模型架構演進
- 35:20LLaVA OneVision 擴展影像與影片處理
- 56:46Qwen 系列多階段訓練與強勁表現
- 1:02:24多模態對齊中語言模型保持凍結
- 1:06:45Chameleon 將所有模態轉為離散 token
- 1:10:11VQ-VAE 編碼與語言模型訓練流程
- 1:13:24離散化限制與多模態處理根本挑戰
提到的工具與公司
- CLIP
- LLaVA
- LLaVA OneVision
- SigLIP
- Qwen-2
- VQ-VAE
- AnyRes
適合誰看
正在學習機器學習原理、想深入了解多模態模型架構或準備相關面試的程式開發者。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.55
- 新鮮
- 0.63
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Multimodality and Large Multimodal Models (LMMs)文章 ・ Chip Huyen(部落格)
- Stanford CS25: Transformers United V6 I From Language Models to Native Multimodal Intelligence影片 ・ Stanford Online ・ 1 小時 5 分
- Coding a Multimodal (Vision) Language Model from scratch in PyTorch with full explanation影片 ・ Umar Jamil ・ 5 小時 46 分(在新分頁開啟原站)
- Stanford CME295 Transformers & LLMs | Autumn 2026 | Lecture 1 - Transformers影片 ・ Stanford Online ・ 1 小時 44 分(在新分頁開啟原站)
- NeoMME: an efficient Multimodal-native and Multilingual Encoder文章 ・ Hugging Face Blog
- 【生成式AI導論 2024】第10講:今日的語言模型是如何做文字接龍的 — 淺談Transformer (已經熟悉 Transformer 的同學可略過本講)影片 ・ Hung-yi Lee ・ 38 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
