讀原文(在新分頁開啟原站)連到 Hugging Face Blog
摘要
介紹了 NeoMME,一個雙語雙模態基礎編碼器,採用單一 Transformer 架構處理文字與圖片。它不使用預訓練的視覺塔或因果語言模型,而是從頭訓練,並使用掩碼離散擴散目標。NeoMME-Retriever 在 ViDoRe 測試中表現優異,260M 版本在引數少於 800M 的模型中達到最高 nDCG@10 分數,且編碼速度達每秒 51 頁,遠超 ColModernVBERT。
This article introduces NeoMME, a bilingual, multimodal foundation encoder based on a single Transformer architecture. Unlike many VLMs, it does not use a separate pretrained vision tower or causal language model, training from scratch with a masked discrete-diffusion objective. NeoMME-Retriever out…
重點
- NeoMME 是基於單一 Transformer 的雙語雙模態基礎編碼器,無需預訓練視覺塔。
- 260M 引數版本在 ViDoRe 測試中 nDCG@10 分數為 0.523,超越所有小於 800M 的模型。
- 模型每秒可編碼 51 頁,速度是 ColModernVBERT 的兩倍。
提到的工具與公司
- ColPali
- ViDoRe
- Qdrant
- Weaviate
- Milvus
適合誰看
研究視覺檢索、多模態模型開發或需要高效雙語編碼器的資料科學家。
摘要依據
- 依據
- 文章全文
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.89
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Coding a Multimodal (Vision) Language Model from scratch in PyTorch with full explanation影片 ・ Umar Jamil ・ 5 小時 46 分(在新分頁開啟原站)
- Generalized Visual Language Models文章 ・ Lilian Weng(部落格)
- Meta is back with Muse Glimmer: local, agentic, multimodal, and open source文章 ・ Hugging Face Blog
- Stanford CS25: Transformers United V6 I From Language Models to Native Multimodal Intelligence影片 ・ Stanford Online ・ 1 小時 5 分(在新分頁開啟原站)
- Multimodality and Large Multimodal Models (LMMs)文章 ・ Chip Huyen(部落格)
- Training and Finetuning Multi-Vector Embedding Models with Sentence Transformers文章 ・ Hugging Face Blog
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)
