跳到主要內容
AI 武林
文章入門EN

NeoMME: an efficient Multimodal-native and Multilingual Encoder

來源 Hugging Face Blog

讀原文(在新分頁開啟原站)連到 Hugging Face Blog

摘要

介紹了 NeoMME,一個雙語雙模態基礎編碼器,採用單一 Transformer 架構處理文字與圖片。它不使用預訓練的視覺塔或因果語言模型,而是從頭訓練,並使用掩碼離散擴散目標。NeoMME-Retriever 在 ViDoRe 測試中表現優異,260M 版本在引數少於 800M 的模型中達到最高 nDCG@10 分數,且編碼速度達每秒 51 頁,遠超 ColModernVBERT。

This article introduces NeoMME, a bilingual, multimodal foundation encoder based on a single Transformer architecture. Unlike many VLMs, it does not use a separate pretrained vision tower or causal language model, training from scratch with a masked discrete-diffusion objective. NeoMME-Retriever out…

重點

  • NeoMME 是基於單一 Transformer 的雙語雙模態基礎編碼器,無需預訓練視覺塔。
  • 260M 引數版本在 ViDoRe 測試中 nDCG@10 分數為 0.523,超越所有小於 800M 的模型。
  • 模型每秒可編碼 51 頁,速度是 ColModernVBERT 的兩倍。

提到的工具與公司

  • ColPali
  • ViDoRe
  • Qdrant
  • Weaviate
  • Milvus

適合誰看

研究視覺檢索、多模態模型開發或需要高效雙語編碼器的資料科學家。

摘要依據

依據
文章全文

為什麼排在這裡

人氣
0.50
新鮮
0.89

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)