跳到主要內容
AI 武林

電腦視覺與多模態模型

Vision & Multimodal Models ・ 48 筆內容

看得懂圖片與影片的模型,以及傳統電腦視覺。

也叫做:電腦視覺、计算机视觉、computer vision、多模態、多模态、multimodal、VLM、視覺語言模型、OCR

學習路徑

由淺入深:入門 → 進階 → 高階

  1. 入門初窺門徑

  2. 進階登堂入室

  3. 高階爐火純青

排行前 17 名

依相關、人氣、新鮮度綜合排序;站長推薦的加成

最新

依發布時間

  1. PodcastMachine Learning Street Talk進階EN

    How Physical AI Learns Across Language, Video and Action — Ming-Yu Liu(在新分頁開啟原站)

    Ming-Yu Liu 解釋 NVIDIA Cosmos 模型如何透過物理世界學習,將語言、影片與動作整合。該模型結合了視覺語言模型與雙向擴散生成器,並透過共享時間位置機制處理不同速率的訊號,讓機器人能像人類一樣理解世界並執行任務。

    ※ 摘要僅根據標題與說明