跳到主要內容
AI 武林
影片入門中文5.5 萬 次觀看

【生成式AI導論 2024】第15講:為什麼語言模型用文字接龍,圖片生成不用像素接龍呢?— 淺談生成式人工智慧的生成策略

來源 Hung-yi Lee人物 李宏毅 Hung-yi Lee

看影片(在新分頁開啟原站)連到 Hung-yi Lee

摘要

探討生成式 AI 中文字接龍與畫素接龍的生成策略差異,解釋為何影像與語音多採用非自迴歸方式。觀眾可了解不同基本單位(Token、Pixel、Sample)的組合邏輯,並掌握自迴歸與非自迴歸模型的優缺點及結合應用。

This video explains why language models use token-by-token generation while image models often use parallel pixel generation, comparing autoregressive and non-autoregressive strategies. It covers the trade-offs between speed and quality in AI generation methods and how modern models combine both.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 文字接龍適合文字生成,品質高但速度慢。
  • 影像與語音常用非自迴歸方式,速度快但易出錯。
  • 現代影像模型常結合兩種策略以提升效率與品質。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00文字影像聲音皆由有限基本單位構成
  2. 03:40聲音訊號由取樣點與解析度組成
  3. 05:44不同模態生成皆為基本單位接龍
  4. 12:53Auto Regressive 方式生成速度過慢
  5. 16:04Non Auto Regressive 策略品質較差
  6. 20:23Non Auto Regressive 面臨多變性問題
  7. 24:49透過額外向量解決腦補不一致問題
  8. 29:29採用 AutoEncoder 壓縮再還原圖片
  9. 35:44拆解生成步驟以減少腦補不一致
  10. 41:41用串聯非自迴歸取代自迴歸加速
  11. 44:27結合兩種模型各取長處生成影像

提到的工具與公司

  • Llama2
  • GPT-3.5
  • GPT-4
  • VALL-E
  • WevNet
  • MidJourney
  • StableDiffusion
  • DALLE

適合誰看

對生成式 AI 原理感興趣的學習者或開發者。

摘要依據

講者
李宏毅
依據
人工字幕

為什麼排在這裡

人氣
0.48
新鮮
0.04

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)