AI search

Exa Highlights:用 1/16 的 token 做到同等準確度,agent 搜尋的成本瓶頸有解了?

Exa 宣稱新版 Highlights 在部分 evals 上以約 94% 更少 token 產出更高品質結果:SimpleQA 上 500 字元追平前 8000 字元的準確度,token 少 16 倍。本文拆解逐請求、不快取、100 毫秒內完成的萃取機制,檢視自報數據的讀法與限制,並整理多輪 agent 搜尋的導入判斷。

Exa Highlights:用 1/16 的 token 做到同等準確度,agent 搜尋的成本瓶頸有解了? — 文章封面
本頁內容6 個段落
  1. 三組數字,先學會怎麼讀
  2. 機制:逐請求、不快取、100 毫秒內完成
  3. 不只公開 API:自家 agent 產品的檢索基底
  4. 取捨與限制
  5. Builder 建議
  6. 參考來源

跑過多輪搜尋 agent 的人都很熟悉這本帳:每一輪搜尋把整頁內容塞回 context,答案只佔其中幾句,其餘是導覽、頁尾與重複的 boilerplate;搜尋輪數一多,token 成本與 latency 一起線性膨脹。Exa 把這個現象叫 context bloat,並認為它是 agentic search 最該先解的問題——4 月 22 日發佈的 Highlights 更新,做法就是把「讓 agent 讀整頁」換成「只讀與這次 query 相關的段落」。

三組數字,先學會怎麼讀

Exa 在文中給出三組關鍵數字。先說清楚性質:全部是 Exa 自報的評測結果,沒有第三方驗證,「部分 evals」也沒有指名具體 benchmark,應視為廠商數據而非可重製的結論。

宣稱 內容
準確度等價 SimpleQA 上,500 字元的 Highlights 追平頁面前 8000 字元的準確度
token 節省 同一組比較少用 16 倍 token;Exa 另宣稱部分 evals 以約 94% 更少 token 產出更高品質結果
更大預算 4k 字元的 Highlights 優於 32k 字元的全文

三組數字裡最扎實的是 SimpleQA 那組:500 個字元的摘錄達到前 8000 字元原文的準確度,token 用量少 16 倍。「約 94%」那組是行銷摘要層級的宣稱,缺少可比較的基準細節;第三組(4k 勝 32k)說明預算放寬後優勢仍在。對 builder 而言,方向比數字重要:摘錄的品質在高壓縮比下沒有崩掉,這才是這篇公告的核心訊息。

機制:逐請求、不快取、100 毫秒內完成

Highlights 是 Exa 自家的萃取方法(in-house method),目標是從網頁抽出與該次 query 最相關的 excerpts。三個設計決策值得注意。第一,它對每個請求重新執行、不做快取——同一個頁面在不同 query 下會抽出不同段落,Exa 選擇相關性優先於重用。第二,每次執行在 100 毫秒內完成,快到可以直接放進 agent loop 的每一步,不必為了等摘要犧牲回應速度。第三,Exa 說這個模型經過多輪研究,探索過多種架構與訓練配方才採用現行作法,並宣稱近期在技術文件(API references、SDK docs)與長文件(specs、research papers)上進步顯著。

長文件正是差距最大的場景。在長頁面、小 context budget 的比較裡,Highlights 與對手方法在 500 字元處的對比是 60% 對 6%:對手方法在滿是 boilerplate 的長文件裡幾乎找不到正確段落,Highlights 則把答案段落直接頂到最前面。這也是多輪搜尋特別受惠的原因——每一輪都省,乘上輪數就是量級差異。

不只公開 API:自家 agent 產品的檢索基底

Highlights 不只是對外的 Highlights API。Exa 自家的 agentic endpoints——/answer、Deep、Websets——內部同樣以 Highlights 作為 retrieval substrate:這些產品 agent loop 的每一次迭代,讀的都是 highlights 而不是原始頁面內容。Exa 並進一步宣稱,其 agentic 產品在 latency、cost、quality 三個軸上對競爭系統達到 Pareto dominant——這同樣是自報宣稱,但結構上說得通:檢索層先把 token 效率做起來,下游產品自然同時繼承速度與成本優勢,不需要靠事後壓縮。

取捨與限制

導入前該誠實面對四件事。其一,所有數字皆為 Exa 自報,無第三方驗證,「部分 evals」未指名 eval,複製結論前應用自己的查詢集驗證。其二,原文完全沒有揭露 Highlights 的定價或計費方式,成本模型要自行確認。其三,生態綁定:Highlights 是 Exa API 的一部分,用其他搜尋引擎或自建檢索的團隊拿不到直接好處,選項只剩換供應商或自己訓練類似模型。其四,任何摘錄都會丟棄上下文,eval 上的 recall 不等於你 domain 上的表現——摘錄漏掉的細節,agent 不會知道它漏掉了。

Builder 建議

三個可以直接落地的判斷。第一,把摘錄當成 agent 的閱讀介面,而不是輸出前的裝飾:在檢索階段就只餵相關段落,比拿到全文再篩選便宜一個量級,也讓 context window 留給真正的推理。第二,長文件工作負載優先導入——API references、SDK 文件、研究論文是 60% 對 6% 差距發生的地方,也是 token 帳單最痛的地方。第三,如果已經在 Exa 生態內,Highlights 幾乎是零成本升級;如果不在,這篇公告至少給了一個明確的訓練目標:檢索層該學會「為特定 query 抽特定段落」,而不是回傳固定長度的頁首。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵