做企業搜尋或 RAG 的團隊,長期面對一個兩難:用大模型建索引品質好,但查詢端的延遲和成本會跟著漲;用小模型省錢,索引品質又得讓步。Cohere 在 2026 年 9 月 30 日發表的 Embed 5,把這個取捨拆成了兩個可以獨立決定的問題。
一個向量空間,兩種檔位
Embed 5 分為 Pro 和 Fast 兩個檔位。Pro 主打最高檢索品質,定價每百萬 token 0.12 美元;Fast 針對延遲和成本敏感的工作負載,定價 0.08 美元。兩者的關鍵設計是:它們共用同一個 embedding 空間,任意一邊產生的向量可以直接互相比較。
對 builder 來說,這代表一個很務實的部署模式:用 Pro 離線建索引,把品質做滿;線上查詢走 Fast,壓低每次搜尋的延遲和費用,而且全程不必重建索引。Cohere 表示,他們在 40 個開發資料集上測試了所有跨模型配對,Fast 查詢平均只損失 1.6% 的品質,Pro 查詢損失 2.7%,沒有任何資料集出現重大失敗。在 agentic 工作流裡,一個任務可能觸發數十次檢索,查詢端省下來的錢會被乘上去。
品質數字講了什麼
根據 Cohere 公布的評測,Embed 5 Pro 在 ViDoRe V3 上平均 85.8 分,比 Embed 4 進步 8.8 分,領先 Voyage 4 Large(83.7)、Gemini Embedding 2(83.2)和 OpenAI text-embedding-3-large(75.5)。金融文件是它最強的戰場:在 FinanceBench、FinQA 和 ViDoRe V3 Finance 三個基準上,Pro 都排第一,Fast 也都排第二。對照 OpenAI 的模型,FinanceBench 的差距拉到 21.4 分。
多模態是另一個重點。傳統 pipeline 把 PDF 轉成純文字再嵌入,表格的行列關係、多欄排版的閱讀順序經常在過程中丟掉。Embed 5 支援直接嵌入頁面圖像,或把圖像和 metadata 融合成單一向量;在融合文字加圖像的測試上,Pro 平均 82.3,Gemini Embedding 2 是 61.3。兩個檔位都支援 128K token 上下文、100 多種語言,以及 Matryoshka 表示法和 int8、binary 等壓縮輸出格式,讓向量儲存成本可以往下壓。
評測方法本身也在換
Embed 5 是第一個用 RCP-nDCG@10 評測的模型系列。這個方法不再只對照固定的標註標籤,而是針對每個查詢產生相關性標準來評分,能捕捉到「答案 key 之外但其實相關」的文件。我們之前已經在另一篇文章裡拆解過 Cohere 用 RCP-nDCG@10 重寫檢索評測 的思路,這次等於是方法論第一次實際套在新模型上。
這對你的選型意味著什麼
有幾件事值得納入評估。第一,如果你的 corpus 充滿財報、法規、掃描文件這類結構複雜的資料,這批數字值得親自驗證——尤其是 parsed PDF 那一組,因為解析品質本身就會影響結果。第二,「Pro 索引、Fast 查詢」的模式聽起來很省,但 1.6% 和 2.7% 的平均損失是跨 40 個資料集的平均,你自己的 corpus 可能在分佈的某一端,值得用自家資料跑一輪再決定。
第三,供應商鎖定是真實的代價。共用向量空間只在 Cohere 生態內成立,換模型仍等於重建索引。Embed 5 已在 Cohere API、Microsoft Foundry 和 Amazon SageMaker 上架,Pro 和 Fast 皆支援自托管,若私有部署是硬需求,可以把它納入比較。最務實的下一步:挑你最有代表性的 100 筆查詢,分別用兩個檔位跑 RCP-nDCG@10 之外的實際業務指標,讓數字替你做決定。
