One Operator, Many Drones: Inside Skydio's Autonomy Stack — Suchet Bargoti, Skydio
Suchet Bargoti 展示 Skydio 如何將無人機轉化為可自動起降、執行任務並返回基地的基礎設施。影片包含實機演示,一人透過電腦同時指揮多架無人機進行巡檢、追蹤車輛與緊急應變。
依發布時間
Suchet Bargoti 展示 Skydio 如何將無人機轉化為可自動起降、執行任務並返回基地的基礎設施。影片包含實機演示,一人透過電腦同時指揮多架無人機進行巡檢、追蹤車輛與緊急應變。
演講者 Armen Aghajanyan 提出將視覺語言模型、具身推理與控制整合為單一具身基礎模型,解決影片預訓練資料稀疏與上下文膨脹問題。
Jerry Liu 說明 2026 年 RAG 演變為「代理 harness」與「上下文層」,強調 PDF 等檔案因非為機器設計而難以直接理解。
Adit Abraham 分享如何將傳統檔案處理與代理系統結合,解決 PDF 解析難題。內容涵蓋從 RAG 到代理的轉變、混合使用傳統電腦視覺與視覺語言模型、以及代理層級的 OCR 校對技術,幫助建立高準確度與高召回率的檔案處理管道。
Aditya Gautam 分享 Meta 如何處理百萬級短影片資料中的模態對齊與原創性歸屬問題。透過三個專責代理(觀察者、審查者、檢索者)與小型視覺語言模型,解決資料雜亂、多語言與無基準真值等挑戰,並最佳化成本與延遲。
Sitanshu Gupta 介紹 CoreWeave 正在構建的推理平台,支援無伺服器、預留通量與專屬部署。平台透過 KV 快取感知的路由、快取外掛與量化技術,最佳化不同工作負載的價格與效能表現。
Meta 工程師分享大規模推理系統的運營挑戰,指出推理流量已超越傳統微服務,需透過路由、快取、批處理與排程進行端到端管理。文章強調以「成功任務成本」為核心指標,並提出避免、共享、移動、延遲四種最佳化策略,以及建立專屬推理控制平面的重要性。
Waymo 共同執行長 Dmitri Dolgov 分享從演示到真正產品跨越的七個技術教訓,強調物理世界 AI 需將安全視為基礎而非後顧之憂。
訪談邀請盛穎分享其從數學研究轉向 AI 基礎設施的歷程,深入探討 SGLang 如何將學術概念轉化為生產級推理引擎。內容涵蓋 xAI 的經驗、RadixArk 的創立,以及對 AI 平權與開源的觀點。
專訪 NVIDIA 機器人部門產品總監 Spencer Huang,深入解析物理 AI、代理 AI 與人形機器人的差異與發展。
訪談深入探討中國具身智慧與機器人產業的商業化現狀,透過魔法原子總裁顧詩韜的視角,分析中美公司在供應鏈、技術路線與生態策略上的差異。內容涵蓋從工業場景落地的具體案例、如何構建護城河以應對價格戰,以及公司未來的全球化佈局與上市規劃。
唐文斌回顧中國最早 AI 創業公司「曠視」的歷程,並介紹新創公司「原力靈機」的具身智慧策略。節目探討了從多模態預訓練到機器人資料整合的技術路徑,以及為何選擇不專注於人形機器人而轉向模組化組合的商業考量。
訪談深入解析 Yann LeCun 對當前生成式 AI 路線的質疑,並介紹其提出的 JEPA 架構。內容探討為何物理世界 AGI 無法僅靠現有模型達成,以及 JEPA 如何透過建立世界模型來解決此問題。
訪談具身智慧創業者賈鵬,回顧其從輝達到理想的智駕經驗,並探討至簡動力如何打造具備技術、戰略、產品等多面能力的團隊。內容涵蓋具身智慧的技術路徑、組織架構設計及行業發展趨勢,適合關注具身智慧創業與技術落地的讀者。
Podcast 訪談探討混合架構(如 Olmo Hybrid)如何結合 RNN 與注意力機制,理論上提升表達力與效率。講者分析現有模型實驗結果,指出工具支援不足導致實際效能未達預期,並預測未來大模型可能採用此架構。
訪談 Flexion Robotics 創辦人 Nikita Rudin,探討自主機器人落地的挑戰與現況。內容涵蓋強化學習、模擬訓練與真實環境的差距(Sim2Real),以及視覺輸入如何增加複雜度。
探討企業如何透過 AI 自動化後台流程並實現實際投資回報,重點在於從雲端測試轉向生產環境的挑戰與解決方案。講者分享了與 HPE 合作在科羅拉多州維爾市推動「代理智慧城市」專案的經驗,包括利用多代理系統處理網站無障礙合規(508 合規)與地…
訪談北大助理教授王鶴,探討具身智慧的學術源流、從邊緣到主流的演變,以及 ChatGPT 帶動下的產業泡沫與亂象。內容涵蓋 VLM 為何弱於 LLM、合成資料的挑戰,以及具身智慧應聚焦「生產力」而非單純「智慧」的觀點。
訪談由陳建宇主講,梳理人形機器人從專用走向通用的演進路徑,重點解析 VLA(視覺語言動作)基座模型與經典論文。內容涵蓋如何利用大型語言模型替代規劃、感知與執行,並探討Scaling Law在機器人領域的應用前景與商業落點。
訪談理想汽車自動駕駛研發副總裁郎咸朋,回顧十年技術演進與關鍵節點。內容涵蓋從高精地圖與鐳射雷達到特斯拉純視覺方案的轉變,深入解析 BEV、Transformer 及端到端架構原理,並探討 L3/L4 級別定義與資料驅動策略。
依人氣
Waymo 共同執行長 Dmitri Dolgov 分享從演示到真正產品跨越的七個技術教訓,強調物理世界 AI 需將安全視為基礎而非後顧之憂。
Jerry Liu 說明 2026 年 RAG 演變為「代理 harness」與「上下文層」,強調 PDF 等檔案因非為機器設計而難以直接理解。
專訪 NVIDIA 機器人部門產品總監 Spencer Huang,深入解析物理 AI、代理 AI 與人形機器人的差異與發展。
Adit Abraham 分享如何將傳統檔案處理與代理系統結合,解決 PDF 解析難題。內容涵蓋從 RAG 到代理的轉變、混合使用傳統電腦視覺與視覺語言模型、以及代理層級的 OCR 校對技術,幫助建立高準確度與高召回率的檔案處理管道。
Podcast 訪談探討混合架構(如 Olmo Hybrid)如何結合 RNN 與注意力機制,理論上提升表達力與效率。講者分析現有模型實驗結果,指出工具支援不足導致實際效能未達預期,並預測未來大模型可能採用此架構。
訪談深入探討中國具身智慧與機器人產業的商業化現狀,透過魔法原子總裁顧詩韜的視角,分析中美公司在供應鏈、技術路線與生態策略上的差異。內容涵蓋從工業場景落地的具體案例、如何構建護城河以應對價格戰,以及公司未來的全球化佈局與上市規劃。
Sitanshu Gupta 介紹 CoreWeave 正在構建的推理平台,支援無伺服器、預留通量與專屬部署。平台透過 KV 快取感知的路由、快取外掛與量化技術,最佳化不同工作負載的價格與效能表現。
Suchet Bargoti 展示 Skydio 如何將無人機轉化為可自動起降、執行任務並返回基地的基礎設施。影片包含實機演示,一人透過電腦同時指揮多架無人機進行巡檢、追蹤車輛與緊急應變。
Meta 工程師分享大規模推理系統的運營挑戰,指出推理流量已超越傳統微服務,需透過路由、快取、批處理與排程進行端到端管理。文章強調以「成功任務成本」為核心指標,並提出避免、共享、移動、延遲四種最佳化策略,以及建立專屬推理控制平面的重要性。
演講者 Armen Aghajanyan 提出將視覺語言模型、具身推理與控制整合為單一具身基礎模型,解決影片預訓練資料稀疏與上下文膨脹問題。