EmbeddingGemma 2登場!Google AI搜尋可離線跑 語音找影片 文字搜音訊

Alphabet (GOOGL-US)旗下Google DeepMind宣布推出新一代開放式多模態嵌入模型EmbeddingGemma 2,將原本以文字為主的EmbeddingGemma擴充至程式碼、圖片、影片及音訊,並把不同類型的資料映射到同一個768維向量空間,讓開發者可以在裝置本地直接進行跨模態搜尋、資料檢索及生成式AI應用。
EmbeddingGemma 2建立於Gemma 4架構,擁有7.4億個參數,採Apache 2.0授權,可用於商業產品。Google表示,這款模型的設計重點是以較小的模型規模提供多模態嵌入能力,讓AI搜尋及檢索工作可以直接在手機、個人電腦等消費性硬體上執行,而不必將資料全部傳送至雲端。
EmbeddingGemma 2採模組化架構,文字與程式碼功能只需要2.7億個參數,加入視覺編碼器後為4.4億個參數,加入音訊編碼器後為5.7億個參數,完整啟用文字、程式碼、圖片、影片與音訊功能則使用7.4億個參數。視覺編碼器增加1.7億個參數,音訊編碼器增加3億個參數,開發者可以按照實際需求選擇需要載入的模組。
這種設計讓EmbeddingGemma 2能夠將不同來源的資訊放進同一個語意空間。例如,使用者可以輸入文字搜尋特定照片,也可以利用語音備忘錄尋找相關影片片段,甚至以文字查詢數小時的音訊內容。不同模態的資料雖然經過不同編碼器處理,最後仍會被轉換成可以直接比較語意相似度的向量。
Google表示,EmbeddingGemma 2特別適合需要本地搜尋及檢索的應用,包括個人媒體庫搜尋、文件及程式碼搜尋、影音資料檢索,以及結合生成式AI的檢索增強生成(RAG)系統。由於嵌入運算可以直接在裝置上完成,開發者可降低資料傳輸需求與延遲,同時提高隱私保護能力,部分應用也能在沒有網路連線的情況下運作。
EmbeddingGemma 2的上下文視窗擴大至8192個token,是第一代EmbeddingGemma的4倍。在單一模態、沒有加入文字的情況下,模型最多可處理約5.5分鐘音訊、29張圖片或58個影片畫面,也能處理文字與多種媒體交錯的輸入。
在效能方面,Google表示EmbeddingGemma 2在MTEB Code測試的分數從第一代的68.76提高至78.68,增加9.92分。Google開發者資料則指出,這相當於約14%的效能提升,同時維持第一代EmbeddingGemma在多語言文字上的表現,並進一步加入圖片、影片及音訊檢索能力。
EmbeddingGemma 2也採用Matryoshka Representation Learning(MRL),讓開發者可以把原本768維的輸出向量動態縮減至512、256或128維,以降低向量資料庫的儲存與記憶體需求。Google表示,最多可以降低約6倍儲存需求。
其中,使用256維向量時,文字及程式碼仍可保留大部分原始嵌入品質,而圖片、影片及語音檢索約可維持95%的原始品質,儲存空間則可降至原本約三分之一。若進一步縮減至128維,文字及程式碼約可維持90%品質,但圖片、影片及語音檢索品質可能降至約75%,因此較適合大型文字索引或第一階段搜尋篩選。
Google開發者指南指出,在bfloat16精度下,儲存100萬個768維向量約需要1.5GB記憶體,若縮減至128維,則約需要250MB,代表相同記憶體容量下可以儲存約6倍數量的嵌入向量。
在裝置端執行效率方面,Google表示,經量化後,EmbeddingGemma 2在Pixel 11 Pro上執行文字版本時,主動RAM需求最低約191MB;完整多模態版本則約需要567MB。這使模型能夠在相對有限的裝置資源下執行,而不必依賴大型雲端運算基礎設施。
EmbeddingGemma 2也可以與Gemma 4搭配使用,建立完整的裝置端RAG流程。由於兩者共享文字tokenizer及音訊編碼器架構,Google表示,開發者可以降低兩個模型同時運作時的整體記憶體占用,讓嵌入、搜尋及生成式推理能夠在同一套本地AI流程中完成。
在實際應用上,Google AI Edge Gallery已展示Instant Media Search及Video Moments Finder等功能。前者可利用文字或圖片在裝置上的媒體資料庫尋找語意相近內容,後者則能利用文字或音訊搜尋影片中的特定片段。Google也展示將EmbeddingGemma 2與Gemma 4結合,用於本地檔案檢索及後續內容理解。
除了搜尋與RAG,EmbeddingGemma 2也可以用於分類、路由及即時決策。Google表示,開發者可以透過MediaPipe Decision Task API利用多模態資訊建立即時決策引擎,進一步把模型應用在需要根據文字、圖片、音訊及影片內容做判斷的裝置端AI系統。
EmbeddingGemma 2的推出也延續第一代EmbeddingGemma的開發者生態。Google表示,第一代EmbeddingGemma自去年推出後已累積超過2000萬次下載,開發者利用它建立裝置端搜尋工具及強調隱私的RAG系統。此次第二代模型則將應用範圍從文字擴展到多種媒體格式。
在開發工具方面,EmbeddingGemma 2可透過sentence-transformers 6.1.0以上版本使用,也支援Transformers、MLX、vLLM、llama.cpp、SGLang、Ollama及LM Studio等工具。開發者可以透過Google AI Edge的MediaPipe進行嵌入、檢索及決策任務,也能使用LiteRT進行自訂模型整合,並可透過transformers.js及WebGPU在瀏覽器環境部署。
模型權重目前可在Hugging Face及Kaggle取得,Google也表示,未來將在Gemini Enterprise Agent Platform Model Garden提供相關模型。針對需要進一步調整模型的開發者,Google同時提供Unsloth微調工具的相關支援。
EmbeddingGemma 2另一項重要特色是所有模組仍使用相容的768維共享向量空間。這意味著開發者即使一開始只建立文字索引,日後若要加入圖片或音訊,也不必重新計算既有嵌入資料,只需載入額外編碼器即可擴充系統。
Google表示,EmbeddingGemma 2的核心目標是讓多模態搜尋與檢索能力從雲端進一步下沉至終端裝置。對開發者而言,這不僅可以降低延遲及雲端運算成本,也能讓敏感資料留在使用者裝置內。隨著AI應用逐漸從單純文字互動走向同時理解圖片、聲音、影片及程式碼,能夠在有限硬體資源下處理多模態資料的嵌入模型,將成為建立新一代裝置端AI應用的重要基礎。