跳到主要內容
AI 武林
文章進階中文

740M模型實現裝置端多模態搜尋,Google EmbeddingGemma 2支援文字與影音檢索

來源 iThome

讀原文(在新分頁開啟原站)連到 iThome

摘要

Google 推出 EmbeddingGemma 2 多模態嵌入模型,支援文字、圖片、影片與音訊的裝置端檢索,無需上傳雲端。文章介紹了 7.4 億參數模型的架構、記憶體佔用、向量維度調整及程式碼搜尋能力的提升。

Google launches EmbeddingGemma 2, a 740M parameter multimodal model for on-device text, image, video, and audio search without cloud processing.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • Google 推出可裝置端運作的多模態嵌入模型 EmbeddingGemma 2。
  • 支援文字、影像、音訊混合輸入與語意搜尋,無需雲端處理。
  • 提供 768 維預設向量,可縮減至 128 維以節省儲存空間。

提到的工具與公司

  • EmbeddingGemma 2
  • Gemma 4
  • MediaPipe
  • LiteRT
  • Hugging Face
  • Kaggle

適合誰看

開發者、AI 工程師或希望在本機執行語意搜尋的技術人員。

摘要依據

依據
文章全文

為什麼排在這裡

人氣
0.35
新鮮
1.00

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)