跳到主要內容
AI 武林
影片進階中文3.6 萬 次觀看

【生成式AI時代下的機器學習(2025)】第十二講:語言模型如何學會說話 — 概述語音語言模型發展歷程

來源 Hung-yi Lee人物 李宏毅 Hung-yi Lee

看影片(在新分頁開啟原站)連到 Hung-yi Lee

摘要

李宏毅教授概述語音語言模型的發展歷程,解釋其如何透過語音 token 進行訓練與生成,並探討處理多義輸出、同時聽說等挑戰。課程涵蓋從預訓練到微調的策略,以及相關工具與評估方法,讓讀者了解語音 AI 的技術架構與應用現況。

An overview of the development history of spoken language models, covering their technical principles, challenges, and representative tools.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 語音語言模型透過語音 token 接龍與解碼技術生成聲音。
  • 面對多義輸出與同時聽說的挑戰,需採用特殊訓練策略。
  • 課程介紹 Moshi、Sesame 等模型與相關評估文獻。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00語音語言模型發展歷程概述
  2. 03:41語音模型聽懂與產生聲音
  3. 05:48向量量化將連續訊號轉 Token
  4. 32:56多組 Token 產生長序列挑戰
  5. 36:04分階段生成策略最佳化序列長度
  6. 38:25探討離散 Token 與連續向量優勢
  7. 44:28語音合成模型訓練資料規模
  8. 57:15先產文字再產音的即時回應挑戰
  9. 1:00:27利用epsilon符號拉長文字序列
  10. 1:03:18實驗室開發的統一語音文字分詞法
  11. 1:13:25基於語音接龍的模型實測與雜訊
  12. 1:20:37從預訓練到監督微調的互動路徑
  13. 1:25:14從品質評估轉向雙向即時對話
  14. 1:30:20參考論文與 GitHub 資源深入學習

提到的工具與公司

  • Moshi
  • GPT-4o
  • Gemini
  • Sesame
  • GLM
  • STEP
  • Q1
  • KeyMe

適合誰看

對語音 AI 技術原理、模型架構或相關應用有興趣的學習者。

摘要依據

講者
李宏毅
依據
人工字幕

為什麼排在這裡

人氣
0.49
新鮮
0.15

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)