跳到主要內容
AI 武林

語音與音訊

Speech & Audio ・ 30 筆內容

語音辨識、語音合成與語音 agent。

也叫做:語音辨識、语音识别、語音合成、语音合成、TTS、ASR、speech recognition、text to speech、voice agent、voice agents、Whisper、語音助理

學習路徑

由淺入深:入門 → 進階 → 高階

  1. 入門初窺門徑

  2. 進階登堂入室

  3. 高階爐火純青

排行前 24 名

依相關、人氣、新鮮度綜合排序;站長推薦的加成

  1. 2PodcastThe TWIML AI Podcast進階EN

    From Voice Agents to AI Avatars with Alexander Smola - #777

    Alexander Smola 探討從語音代理到具身 AI 的演進,指出即時語音雖進步顯著,但自然對話仍面臨高門檻。他強調情感智慧與多模態互動是未來關鍵,並分享在嘈雜環境下測試的經驗,認為未來幾個月內語音將更穩定,機器人將開始廣泛應用。

  2. 7文章Hugging Face Blog高階EN

    Measuring benchmark optimization in speech recognition

    探討了語音識別中「benchmark 最佳化」現象,即模型傾向於重現參考資料集中的錯誤或特定拼寫,而非準確聽寫。研究透過三項測試(共識分歧探測、掩碼數字測試、正字法切換測試)量化此問題,發現部分模型會根據參考資料的音訊特徵或拼寫習慣調整輸…

  3. 16影片彭彭的課程入門中文

    JavaScript 語音辨識,使用原生 Web Speech API 做 Speech to Text 功能應用 #教學 #課程 #人工智慧(在新分頁開啟原站)

    本教學介紹如何使用 JavaScript 原生的 Web Speech API 實現語音轉文字功能。內容涵蓋 API 簡介、物件建立、語言設定、啟動偵測及結果取得等步驟,讓讀者掌握基本語音辨識實作。

    1,338次觀看

    ※ 摘要僅根據標題與說明

最新

依發布時間

  1. PodcastThe TWIML AI Podcast進階EN

    From Voice Agents to AI Avatars with Alexander Smola - #777

    Alexander Smola 探討從語音代理到具身 AI 的演進,指出即時語音雖進步顯著,但自然對話仍面臨高門檻。他強調情感智慧與多模態互動是未來關鍵,並分享在嘈雜環境下測試的經驗,認為未來幾個月內語音將更穩定,機器人將開始廣泛應用。

  2. 文章Hugging Face Blog高階EN

    Measuring benchmark optimization in speech recognition

    探討了語音識別中「benchmark 最佳化」現象,即模型傾向於重現參考資料集中的錯誤或特定拼寫,而非準確聽寫。研究透過三項測試(共識分歧探測、掩碼數字測試、正字法切換測試)量化此問題,發現部分模型會根據參考資料的音訊特徵或拼寫習慣調整輸…