From Scratch to SOTA: Training a 3B State-Space Vision Model — Krishna Prasad Srinivasan, Sarvam(在新分頁開啟原站)
介紹 Krishna Prasad Srinivasan 如何從零開始,使用 3B 狀態空間視覺模型,詳細展示訓練過程與架構。
※ 摘要僅根據標題與說明
Vision & Multimodal Models ・ 48 筆內容
看得懂圖片與影片的模型,以及傳統電腦視覺。
也叫做:電腦視覺、计算机视觉、computer vision、多模態、多模态、multimodal、VLM、視覺語言模型、OCR
由淺入深:入門 → 進階 → 高階
NeoMME: an efficient Multimodal-native and Multilingual Encoder
Hugging Face Blog● 有原文
Stanford Online1 小時 50 分○ 無原文
Introducing the Gemini Omni Flash API(在新分頁開啟原站)
Sam Witteveen22 分鐘○ 無原文
Why Tejal Patwardhan stopped underestimating the models - Episode 21
OpenAI Podcast44 分鐘● 有原文
李飞飞发布最新世界模型Atlas | World Labs | 世界模型 | 3D重建 | 视频生成 | 空间智能 | 高斯泼溅 | 机器人仿真 | 多模态AI(在新分頁開啟原站)
Best Partners TV21 分鐘○ 無原文
From VLM/VLA's to Embodied Agents — Armen Aghajanyan, Perceptron AI(在新分頁開啟原站)
AI Engineer21 分鐘○ 無原文
Stanford CME296 Diffusion & Large Vision Models | Spring 2026 | Lecture 7 - Evaluation(在新分頁開啟原站)
Stanford Online1 小時 41 分○ 無原文
Generalized Visual Language Models
Lilian Weng(部落格)● 有原文
Stanford Online1 小時 5 分○ 無原文
依相關、人氣、新鮮度綜合排序;站長推薦的加成
介紹 Krishna Prasad Srinivasan 如何從零開始,使用 3B 狀態空間視覺模型,詳細展示訓練過程與架構。
※ 摘要僅根據標題與說明
指出,部署大型視覺語言模型存在風險,建議改用專為特定技能設計的模型來解決問題。
※ 摘要僅根據標題與說明
介紹了 NeoMME,一個雙語雙模態基礎編碼器,採用單一 Transformer 架構處理文字與圖片。它不使用預訓練的視覺塔或因果語言模型,而是從頭訓練,並使用掩碼離散擴散目標。
Stanford CS25 課程介紹了從語言模型到原生多模態智慧的演進,內容涵蓋了 Transformer 架構的演變與應用。
※ 摘要僅根據標題與說明
Stanford 線上課程介紹了大規模視覺模型與擴散模型在 2026 年春季的趨勢,內容聚焦於前沿技術發展。
※ 摘要僅根據標題與說明
Tejal Patwardhan 探討舊版評估基準已過時,並強調必須建立前沿評估體系以預測模型能力。她與主持人討論了如何衡量模型進步、避免被遊戲化,以及評估對研究的重要性。
李飛飛宣佈推出名為 Atlas 的最新世界模型,旨在整合多模態資訊以實現高品質的 3D 重建與影片生成。
※ 摘要僅根據標題與說明
Stanford 線上課程《Diffusion & Large Vision Models》第七課,探討大語言模型與大視覺模型的評估方法。
※ 摘要僅根據標題與說明
Stanford CS336 第 17 課介紹如何從頭開始學習語言模型,專注於多模態下的指令跟隨。
※ 摘要僅根據標題與說明
Meta 推出 Muse Glimmer 30B 多模態模型,支援本地執行、代理式任務、多模態輸入及開放原始碼。該模型結合 ViT 編碼器與 DFlash 猜測解碼,在推理效能與程式碼生成等任務上表現優異,並提供完整的部署與最佳化指南。
介紹 Gemini Omni Flash API,說明其如何將 AI 模型加速至極速,並展示其如何整合多模態與多語言功能。
※ 摘要僅根據標題與說明
※ 摘要僅根據標題與說明
※ 摘要僅根據標題與說明
※ 摘要僅根據標題與說明
專訪 Qualcomm 研究員 Munawar Hayat,探討 VLM 物件虛構問題及注意力引導的對齊方法。他介紹了解決複雜檢索任務的新對比學習策略,並說明如何透過新測試台架評估多個人物生成時的身份洩漏問題。
※ 摘要僅根據標題與說明
探討 GPT 5.2 的真實強項,指出其並非單純的語言模型升級,而是透過整合多模態能力與大規模資料,展現出接近人類水平的數位智慧潛力。
※ 摘要僅根據標題與說明
介紹兩種非傳統電腦:類比運算與神經形態運算,探討它們如何挑戰數位電腦,並分析其未來潛力。
※ 摘要僅根據標題與說明
依發布時間
※ 摘要僅根據標題與說明
介紹 Krishna Prasad Srinivasan 如何從零開始,使用 3B 狀態空間視覺模型,詳細展示訓練過程與架構。
※ 摘要僅根據標題與說明
Armen Aghajanyan 探討從視覺語言模型到具身智慧的演進,介紹如何打造能自主行動的 AI 實體。
※ 摘要僅根據標題與說明
LFM2.5-VL-DSpark 是一款專為加速視覺語言模型推理設計的擴充模型,僅增加 8.9% 引數即可提升 2.6 倍至 3.1 倍的推理速度。該模型支援 Llama.cpp、MLX-VLM 及 SGLang 等工具,並提供即時支援。
指出,部署大型視覺語言模型存在風險,建議改用專為特定技能設計的模型來解決問題。
※ 摘要僅根據標題與說明
Ming-Yu Liu 解釋 NVIDIA Cosmos 模型如何透過物理世界學習,將語言、影片與動作整合。該模型結合了視覺語言模型與雙向擴散生成器,並透過共享時間位置機制處理不同速率的訊號,讓機器人能像人類一樣理解世界並執行任務。
※ 摘要僅根據標題與說明
李飛飛宣佈推出名為 Atlas 的最新世界模型,旨在整合多模態資訊以實現高品質的 3D 重建與影片生成。
※ 摘要僅根據標題與說明
Peter Gostev 介紹了 GPT-6 Astra 模型,這是 OpenAI 最新推出的大型語言模型,主要用於處理多模態資料。
※ 摘要僅根據標題與說明
介紹了 NeoMME,一個雙語雙模態基礎編碼器,採用單一 Transformer 架構處理文字與圖片。它不使用預訓練的視覺塔或因果語言模型,而是從頭訓練,並使用掩碼離散擴散目標。
Tormod Ree 介紹 Neat 公司如何將 11 台以上攝影機與數十個麥克風整合,利用電腦視覺技術分析會議現場的參與者、互動與視線,使會議系統從被動記錄轉變為主動參與者。
Z.ai 正式推出 GLM-5.3-Flash,這是一款原生多模態模型,擁有 100 萬 token 上下文視窗和 320 億總引數。
Meta 推出 Muse Glimmer 30B 多模態模型,支援本地執行、代理式任務、多模態輸入及開放原始碼。該模型結合 ViT 編碼器與 DFlash 猜測解碼,在推理效能與程式碼生成等任務上表現優異,並提供完整的部署與最佳化指南。