跳到主要內容
AI 武林
影片進階EN9,815 次觀看

Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 17: Alignment - Multimodality

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

介紹多模態模型如何將圖片、音訊等非文字資料轉換為 transformer 可處理的 token,並探討 CLIP、LLaVA 等架構的運作原理與資料處理策略。看完後能理解多模態系統如何整合不同感官輸入,以及面對高解析度與長上下文時的技術挑戰。

This lecture explains how multimodal models convert images and audio into tokens for transformers, covering CLIP, LLaVA, and training challenges like loss instability.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 多模態模型需將圖片、音訊等非文字資料轉化為 token 才能輸入 transformer。
  • CLIP 透過對比學習建立圖片與文字的高層級語義對齊,LLaVA 則升級為處理多張圖與影片。
  • 直接將多模態混合訓練會導致損失不穩定,需透過特定正規化或分階段訓練來解決。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:05課程調整:從強化學習轉向多模態概覽
  2. 04:28CLIP 原理:利用網路資料進行語意對齊
  3. 09:45視覺編碼器:影像尺寸處理與 ResNet 演算法
  4. 11:46視覺 Transformer:Patch 分割與注意力池化機制
  5. 16:57訓練策略:跨熵損失與零樣本分類優勢
  6. 21:53SigLIP 架構:簡化二分類與大批次需求挑戰
  7. 25:14效率最佳化:SigLIP 的並行訓練與硬體加速
  8. 28:44LLaVA 與 Qwen 多模態模型架構演進
  9. 35:20LLaVA OneVision 擴展影像與影片處理
  10. 56:46Qwen 系列多階段訓練與強勁表現
  11. 1:02:24多模態對齊中語言模型保持凍結
  12. 1:06:45Chameleon 將所有模態轉為離散 token
  13. 1:10:11VQ-VAE 編碼與語言模型訓練流程
  14. 1:13:24離散化限制與多模態處理根本挑戰

提到的工具與公司

  • CLIP
  • LLaVA
  • LLaVA OneVision
  • SigLIP
  • Qwen-2
  • VQ-VAE
  • AnyRes

適合誰看

正在學習機器學習原理、想深入了解多模態模型架構或準備相關面試的程式開發者。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.55
新鮮
0.63

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)