AGENTIC COMMONSAI 產業簡報

繁中EN

主題企業 AI出版 2026-10-09

返回文章列表AI

索引和查詢可以用兩顆模型:Embed 5 的雙檔設計改寫 RAG 的成本算式

做企業搜尋或 RAG 的團隊,長期面對一個兩難:用大模型建索引品質好,但查詢端的延遲和成本會跟著漲;用小模型省錢,索引品質又得讓步。Cohere 在 2026 年 9 月 30 日發表的 Embed 5,把這個取捨拆成了兩個可以獨立決定的問題。

一個向量空間,兩種檔位

Embed 5 分為 Pro 和 Fast 兩個檔位。Pro 主打最高檢索品質,定價每百萬 token 0.12 美元;Fast 針對延遲和成本敏感的工作負載,定價 0.08 美元。兩者的關鍵設計是:它們共用同一個 embedding 空間,任意一邊產生的向量可以直接互相比較。

對 builder 來說,這代表一個很務實的部署模式:用 Pro 離線建索引,把品質做滿;線上查詢走 Fast,壓低每次搜尋的延遲和費用,而且全程不必重建索引。Cohere 表示,他們在 40 個開發資料集上測試了所有跨模型配對,Fast 查詢平均只損失 1.6% 的品質,Pro 查詢損失 2.7%,沒有任何資料集出現重大失敗。在 agentic 工作流裡,一個任務可能觸發數十次檢索,查詢端省下來的錢會被乘上去。

品質數字講了什麼

根據 Cohere 公布的評測,Embed 5 Pro 在 ViDoRe V3 上平均 85.8 分,比 Embed 4 進步 8.8 分,領先 Voyage 4 Large(83.7)、Gemini Embedding 2(83.2)和 OpenAI text-embedding-3-large(75.5)。金融文件是它最強的戰場:在 FinanceBench、FinQA 和 ViDoRe V3 Finance 三個基準上,Pro 都排第一,Fast 也都排第二。對照 OpenAI 的模型,FinanceBench 的差距拉到 21.4 分。

多模態是另一個重點。傳統 pipeline 把 PDF 轉成純文字再嵌入,表格的行列關係、多欄排版的閱讀順序經常在過程中丟掉。Embed 5 支援直接嵌入頁面圖像,或把圖像和 metadata 融合成單一向量;在融合文字加圖像的測試上,Pro 平均 82.3,Gemini Embedding 2 是 61.3。兩個檔位都支援 128K token 上下文、100 多種語言,以及 Matryoshka 表示法和 int8、binary 等壓縮輸出格式,讓向量儲存成本可以往下壓。

評測方法本身也在換

Embed 5 是第一個用 RCP-nDCG@10 評測的模型系列。這個方法不再只對照固定的標註標籤,而是針對每個查詢產生相關性標準來評分,能捕捉到「答案 key 之外但其實相關」的文件。我們之前已經在另一篇文章裡拆解過 Cohere 用 RCP-nDCG@10 重寫檢索評測 的思路,這次等於是方法論第一次實際套在新模型上。

這對你的選型意味著什麼

有幾件事值得納入評估。第一,如果你的 corpus 充滿財報、法規、掃描文件這類結構複雜的資料,這批數字值得親自驗證——尤其是 parsed PDF 那一組,因為解析品質本身就會影響結果。第二,「Pro 索引、Fast 查詢」的模式聽起來很省,但 1.6% 和 2.7% 的平均損失是跨 40 個資料集的平均,你自己的 corpus 可能在分佈的某一端,值得用自家資料跑一輪再決定。

第三,供應商鎖定是真實的代價。共用向量空間只在 Cohere 生態內成立,換模型仍等於重建索引。Embed 5 已在 Cohere API、Microsoft Foundry 和 Amazon SageMaker 上架,Pro 和 Fast 皆支援自托管,若私有部署是硬需求,可以把它納入比較。最務實的下一步:挑你最有代表性的 100 筆查詢,分別用兩個檔位跑 RCP-nDCG@10 之外的實際業務指標,讓數字替你做決定。

參考來源

AGENTIC COMMONS由 PHLEGON LABS 經營
分享X電郵
支持我們

相關閱讀

  1. 答案 key 之外的相關文件該算分:Cohere 用 RCP-nDCG@10 重寫檢索評測

    Cohere 提出 RCP-nDCG@10,用校準過的 AI 評審按 rubric 逐篇評分,補上傳統 nDCG 漏判相關文件的覆蓋缺口。

    Information Retrieval

  2. Mistral Large 4 公開預覽:開放權重首次打進企業關鍵工作負載

    Mistral 推出 1 兆參數、490 億活躍參數的 Mistral Large 4 公開預覽,權重月底釋出,主打資安與主權部署。

    Mistral

  3. 選 embedding 模型前,先問你要檢索什麼:OpenRouter 2026 年短名單的實務讀法

    OpenRouter 以 37 個 embedding 模型與 28 項 API 檢查,整理出 RAG、多語、程式碼與圖文檢索的選型起點。

    RAG