看影片(在新分頁開啟原站)連到 Hung-yi Lee
摘要
李宏毅教授概述語音語言模型的發展歷程,解釋其如何透過語音 token 進行訓練與生成,並探討處理多義輸出、同時聽說等挑戰。課程涵蓋從預訓練到微調的策略,以及相關工具與評估方法,讓讀者了解語音 AI 的技術架構與應用現況。
An overview of the development history of spoken language models, covering their technical principles, challenges, and representative tools.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 語音語言模型透過語音 token 接龍與解碼技術生成聲音。
- 面對多義輸出與同時聽說的挑戰,需採用特殊訓練策略。
- 課程介紹 Moshi、Sesame 等模型與相關評估文獻。
章節
依話題轉折切分,標題由 AI 產生
提到的工具與公司
- Moshi
- GPT-4o
- Gemini
- Sesame
- GLM
- STEP
- Q1
- KeyMe
適合誰看
對語音 AI 技術原理、模型架構或相關應用有興趣的學習者。
摘要依據
- 講者
- 李宏毅
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.49
- 新鮮
- 0.15
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
