2026 年 3 月 10 日,Google DeepMind 把 Gemini Embedding 2 推進 Public Preview:第一個以 Gemini 架構打造、原生多模態的嵌入模型。文字、圖片、影片、音訊與 PDF 被映射進同一個 3072 維向量空間,覆蓋超過 100 種語言。公告由產品經理 Min Choi 與傑出工程師 Tom Duerig 具名發布。
對開發者而言,這補上檢索工程最破碎的一塊:過去多模態搜尋得「文字一個模型、圖片一個模型、音訊先轉文字」地拼接,現在有了單一模型的替代品,複雜度與嵌入成本同時下降。
一個模型、一個空間、五種模態
- 文字輸入上限 8,192 個 token;單次請求最多 6 張圖片(PNG、JPEG)。
- 影片最長 120 秒(MP4、MOV);PDF 最多 6 頁。
- 音訊採原生輸入,不需先產生中繼文字轉錄——過去語音檢索管線最彆扭的一段。
- 支援交錯輸入:同一請求可混合圖片與文字。
- 官方宣稱在文字、影像與影片任務上的表現超越現有領先模型。
這些限制透露定位:它處理的是「檢索單元」——一頁文件、一段短片、一張圖——而非無限長度的多媒體檔案。8,192 token 的文字上限也遠低於 Gemini 主模型的百萬級上下文:嵌入與生成各司其職。
3072 維與 Matryoshka 截斷
預設輸出 3072 維,採用 Matryoshka Representation Learning:資訊「巢狀」在維度裡,向量可以動態截斷而不需重新訓練。官方建議三個檔位:3072、1536、768 維。
向量資料庫的儲存與搜尋成本大致隨維度線性放大:千萬級索引用 1536 維直接省一半,768 維再對半。Matryoshka 把「品質換成本」從一次工程決策變成一行參數——先全維度離線評估,上線再按延遲預算截斷。
API 與生態系第一天就位
model ID 為 gemini-embedding-2-preview,Gemini API 與 Vertex AI 同步開放;LangChain、LlamaIndex、Haystack、Weaviate、Qdrant、ChromaDB 與 Vertex AI Vector Search 都在第一波整合名單,Google 另附 Colab 筆記本。
切換成本的結構要看清楚:換嵌入模型從來不在 API 呼叫那層,而在索引重建——換了嵌入空間等於全量重算。框架整合降低的是「試用」門檻:把 embedding 函式指向新 model ID,跑一輪評測再決定是否重建索引。
對 RAG 與 Agent 管線的實際影響
三個影響。第一,跨模態檢索變成原生操作:用文字查影片片段、用截圖回找原始文件,不必為每個模態維護獨立索引與對齊邏輯。第二,Google 開發者部落格示範的 agentic multimodal RAG 是最直接的應用——Agent 同時讀螢幕截圖、文件與語音備忘,記憶統一在同一套向量上。第三,鎖定效應值得警惕:統一空間的品質若成立,資料與索引留在 Google 生態系的引力會變大;嵌入空間彼此不可混合,換模型就是全量重建索引,評估時把這筆成本算進去。
同一天,Google 也把 Gemini 推進 Workspace——個人檔案起草、試算表自動填與 Drive 問答。基礎元件與應用同週並進:連 Embedding 都排進常規發布節奏,多模態檢索已是 Gemini 平台的基本盤。
參考來源
- Gemini Embedding 2: Our first natively multimodal embedding model — Google
- Building with Gemini Embedding 2: Agentic multimodal RAG — Google Developers Blog
- Gemini Embedding 2 preview model — Gemini API documentation
本文由 AI 協助自上述來源整理,經人工審核後發布。
