From Voice Agents to AI Avatars with Alexander Smola - #777
Alexander Smola 探討從語音代理到具身 AI 的演進,指出即時語音雖進步顯著,但自然對話仍面臨高門檻。他強調情感智慧與多模態互動是未來關鍵,並分享在嘈雜環境下測試的經驗,認為未來幾個月內語音將更穩定,機器人將開始廣泛應用。
Podcast ・ 國際 ・ 英文 ・ A 級 ・ 27 筆內容 ・ 最近更新 2026/09/30
研究者與從業者訪談
依人氣
Alexander Smola 探討從語音代理到具身 AI 的演進,指出即時語音雖進步顯著,但自然對話仍面臨高門檻。他強調情感智慧與多模態互動是未來關鍵,並分享在嘈雜環境下測試的經驗,認為未來幾個月內語音將更穩定,機器人將開始廣泛應用。
Gimlet Labs 的 Zain Asgar 探討如何透過異質計算架構,讓 AI 代理能在不同硬體上高效執行。他提出將工作負載拆分至 H100、舊版 GPU 及 CPU 的混合方案,並結合 LLM 自主編譯計算核,以平衡成本與效能。
※ 摘要僅根據標題與說明
Rubrik 的 Dev Rishi 與 Sam 探討 AI 代理如何突破傳統安全模型。當代理從回答問題轉向執行工具與業務流程時,預先制定的規則與人工審批開始失效。文章指出,工具許可權擴大導致攻擊面變大,且代理能繞過控制機制。
※ 摘要僅根據標題與說明
專訪 Qualcomm 研究員 Munawar Hayat,探討 VLM 物件虛構問題及注意力引導的對齊方法。他介紹了解決複雜檢索任務的新對比學習策略,並說明如何透過新測試台架評估多個人物生成時的身份洩漏問題。
※ 摘要僅根據標題與說明
探討世界模型與空間 AI 的未來,主持人介紹了從顯式 3D 表示到生成式模型的多元方法,並重點分析 World Labs 的 Marble 系統如何從圖片生成可導航的 3D 世界。
※ 摘要僅根據標題與說明
Illia Polosukhin 探討如何透過私有化與去中心化技術,讓使用者擁有自己的 AI 模型。他介紹了 NEAR 協議如何結合隱私計算與區塊鏈,建立可信的私有雲環境,並提出透過開放訓練、可驗證推理及形式驗證來建立信任的三步驟策略。
※ 摘要僅根據標題與說明
Scott Clark 分享如何透過 Maslow 層次觀測法,結合開源監控與後製分析,揭露 AI 代理在生產環境中常被評估工具遺漏的失敗案例,並探討如何透過向量印跡與演演算法飛輪提升系統可觀測性。
※ 摘要僅根據標題與說明
本訪談探討 AI 在數學領域的進展,從解出難題到提出新概念。Greg Burnham 指出,AI 目前主要依靠「暴力搜尋」與整合先前的知識,尚未展現像人類數學大師那樣的本源創新能力。
本期節目邀請了 HPE 的 AI 業務發展副總裁羅賓·布萊恩與 Kamiwaza 的創始人兼執行長盧克·諾里斯,探討如何利用 AI 系統自動化複雜工作流,並從企業舊資料中挖掘價值。
※ 摘要僅根據標題與說明
斯坦福電機與計算科學教授 Kunle Olukotun 與 Sambanova 系統共同探討動態可重構資料流架構,用於 AI 推理。
※ 摘要僅根據標題與說明
依發布時間
本訪談探討 AI 在數學領域的進展,從解出難題到提出新概念。Greg Burnham 指出,AI 目前主要依靠「暴力搜尋」與整合先前的知識,尚未展現像人類數學大師那樣的本源創新能力。
Alexander Smola 探討從語音代理到具身 AI 的演進,指出即時語音雖進步顯著,但自然對話仍面臨高門檻。他強調情感智慧與多模態互動是未來關鍵,並分享在嘈雜環境下測試的經驗,認為未來幾個月內語音將更穩定,機器人將開始廣泛應用。
斯坦福教授克里斯·波茨探討 AI 的 Tokenomics 與模型基準,指出單純的基準測試無法完整衡量模型進步,需關注 Token 使用量與經濟效益。
※ 摘要僅根據標題與說明
探討世界模型與空間 AI 的未來,主持人介紹了從顯式 3D 表示到生成式模型的多元方法,並重點分析 World Labs 的 Marble 系統如何從圖片生成可導航的 3D 世界。
※ 摘要僅根據標題與說明
Max Welling 探討 AI 突破可能來自物理學,而非更多計算資源。他介紹 CuspAI 如何利用生成式 AI 設計新型材料,並深入討論物理概念如何啟發更優異的 AI 架構。
※ 摘要僅根據標題與說明
探討生成式視覺系統中尚未解決的挑戰,包括如何透過改進訓練目標提升可控性、將場景規劃與渲染分離以增強可靠性,以及如何在邊緣裝置上高效生成高解析度影象。
※ 摘要僅根據標題與說明
Damian Borth 指出,我們常忽視已訓練好的模型本身作為新的訓練資料來源。他介紹了「權重空間學習」方法,將模型視為資料進行最佳化,這能大幅降低開發專模的成本並促進知識跨領域轉移。
※ 摘要僅根據標題與說明
Osmo 創辦人 Alex Wiltschko 談論如何讓電腦擁有嗅覺,並探討建立嗅覺智慧所需的科學基礎與技術挑戰。
※ 摘要僅根據標題與說明
Rubrik 的 Dev Rishi 與 Sam 探討 AI 代理如何突破傳統安全模型。當代理從回答問題轉向執行工具與業務流程時,預先制定的規則與人工審批開始失效。文章指出,工具許可權擴大導致攻擊面變大,且代理能繞過控制機制。
※ 摘要僅根據標題與說明
Alex Bowcut 解釋了為何在稅務等高風險領域,RAG 仍不可或缺。他介紹了 Sphere 開發的 TRAM 系統,該系統結合了檢索、推理與法律審查流程,讓稅務專家能以兩倍速度處理案件,同時確保答案準確可靠。
※ 摘要僅根據標題與說明
Jure Leskovec 探討了 AI for Science 與關係深度學習,介紹了 Kumo 的 RFM2 模型,該模型能在無訓練情況下透過子圖進行上下文學習,並直接處理多表資料。
※ 摘要僅根據標題與說明
Scott Clark 分享如何透過 Maslow 層次觀測法,結合開源監控與後製分析,揭露 AI 代理在生產環境中常被評估工具遺漏的失敗案例,並探討如何透過向量印跡與演演算法飛輪提升系統可觀測性。
※ 摘要僅根據標題與說明
Philip Kiely 探討 AI 推理工程如何成為關鍵工作負載,涵蓋從 API 到自研平台的演進。他分享如何透過批處理、量化等技術縮短研發週期,並介紹 vLLM、SGLang 等現代推理執行時工具。
※ 摘要僅根據標題與說明
Capital One 的 Rashmi Shetty 探討如何在嚴格的監管環境下,設計、部署並擴充套件多代理系統。她介紹了為汽車銷售中心打造的 Chat Concierge,該系統透過解離使用者意圖、呼叫工具與人工轉接,提供安全且個人化…
※ 摘要僅根據標題與說明
斯坦福教授 Stefano Ermon 與 Inception Labs 共同探討將傳統影象生成用的 Diffusion 技術應用於文字與程式碼生成。
※ 摘要僅根據標題與說明
Blitzy 的 Siddhant Pardeshi 探討了如何透過 AI 群組與知識圖譜,實現企業級別的自主軟體開發。他強調以「程式碼是商品」為核心,結合語義訊號與關鍵字搜尋,解決大規模倉庫中的複雜任務。
※ 摘要僅根據標題與說明
獨立研究員塞巴斯蒂安·拉斯克哈探討 2026 年 LLM 演進,從單純模型規模轉向推理與工具整合。他強調自洽性、自我修正及可驗證獎勵學習等技術的重要性,並分析多智慧體系統在實際應用中的價值與可靠性挑戰。
※ 摘要僅根據標題與說明
Yejin Choi 探討小語言模型如何透過合成資料、模仿學習與強化學習提升推理能力,並指出資料多樣性對消除智慧差距的關鍵作用。
※ 摘要僅根據標題與說明
Flexion 創辦人 Nikita Rudin 探討 2026 年自主機器人部署的挑戰,特別強調模擬到現實的轉移困難及視覺輸入帶來的噪音問題。
※ 摘要僅根據標題與說明
Aakanksha Chowdhery 探討如何重新思考 Agentic AI 的預訓練,指出傳統後訓練方法已不足以應對多步驟工作流。她強調需改變注意力機制、損失函式及訓練資料,以支援長程推理與規劃,而非僅依賴上下文檢索。
※ 摘要僅根據標題與說明
專訪 Qualcomm 研究員 Munawar Hayat,探討 VLM 物件虛構問題及注意力引導的對齊方法。他介紹了解決複雜檢索任務的新對比學習策略,並說明如何透過新測試台架評估多個人物生成時的身份洩漏問題。
※ 摘要僅根據標題與說明
Gimlet Labs 的 Zain Asgar 探討如何透過異質計算架構,讓 AI 代理能在不同硬體上高效執行。他提出將工作負載拆分至 H100、舊版 GPU 及 CPU 的混合方案,並結合 LLM 自主編譯計算核,以平衡成本與效能。
※ 摘要僅根據標題與說明
Devi Parikh 與 Yutori 共同探討透過自主代理與視覺化模型,讓使用者能主動與網頁互動的未來。文章指出,基於螢幕截圖而非瀏覽器脆弱的 DOM 結構,能更穩定地處理複雜介面。
※ 摘要僅根據標題與說明
本期節目邀請了 HPE 的 AI 業務發展副總裁羅賓·布萊恩與 Kamiwaza 的創始人兼執行長盧克·諾里斯,探討如何利用 AI 系統自動化複雜工作流,並從企業舊資料中挖掘價值。
※ 摘要僅根據標題與說明
斯坦福電機與計算科學教授 Kunle Olukotun 與 Sambanova 系統共同探討動態可重構資料流架構,用於 AI 推理。
※ 摘要僅根據標題與說明
Jacob Buckman 與 Manifest AI 共同探討如何解決長文字體中的注意力瓶頸。他介紹了視窗注意力、分組查詢注意力及潛在空間注意力等技術,並提出權重狀態平衡與權重狀態 FLOP 比率等概念,以最佳化計算架構。
※ 摘要僅根據標題與說明
Illia Polosukhin 探討如何透過私有化與去中心化技術,讓使用者擁有自己的 AI 模型。他介紹了 NEAR 協議如何結合隱私計算與區塊鏈,建立可信的私有雲環境,並提出透過開放訓練、可驗證推理及形式驗證來建立信任的三步驟策略。
※ 摘要僅根據標題與說明