跳到主要內容
AI 武林
Podcast進階中文

98. 逐篇讲解机器人基座模型和VLA经典论文——“人就是最智能的VLA”

來源 张小珺Jùn|商业访谈录

聽節目(在新分頁開啟原站)連到 张小珺Jùn|商业访谈录

摘要

訪談由陳建宇主講,梳理人形機器人從專用走向通用的演進路徑,重點解析 VLA(視覺語言動作)基座模型與經典論文。內容涵蓋如何利用大語言模型替代規劃、感知與執行,並探討Scaling Law在機器人領域的應用前景與商業落點。

An interview discussing the evolution of humanoid robots towards general-purpose VLA models and key foundational papers in the field.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 大語言模型推動機器人從專用開發轉向通用基座模型。
  • VLA架構透過視覺語言模型整合感知與動作決策。
  • 機器人領域Scaling Law已見端倪,應用潛力大於語言模型。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00通用 VLA 模型與具身智慧背景
  2. 05:11AI 與機器人融合發展脈絡
  3. 41:39ACT 架構與多視角輸入處理
  4. 45:51模仿學習與阿羅哈系統
  5. 50:35Gato 統一模型與多模態整合
  6. 56:02RT-1 任務成功率與資料多樣性
  7. 59:05Google、Berkeley 與派共同研發跨形態 VLA
  8. 1:06:56加入預測未來影像以增強模型理解能力
  9. 1:13:07利用預訓練語言模型並進行微調訓練
  10. 1:54:17在模擬與真機上驗證多工泛化能力
  11. 2:05:05結合強化學習突破監督學習效能瓶頸
  12. 2:09:25作者本科研究雙足機器人控制與硬體
  13. 2:24:13探討機器人領域 Scaling Law 與商業化前景

提到的工具與公司

  • VLM
  • DoReMi
  • VoxPoser

適合誰看

對具身智慧、機器人技術趨勢或相關創業方向感興趣的讀者。

摘要依據

講者
张小珺
依據
語音轉文字

為什麼排在這裡

人氣
0.33
新鮮
0.12

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。聽節目(在新分頁開啟原站)