AGENTIC COMMONSAI 產業簡報

繁中EN

主題AI 代理與工作流出版 2026-10-08

返回文章列表Agent Benchmarks

搜尋 agent 遇上可驗證的答案表:ATLAS 把評測重點拉回搜尋本身

為什麼又要一個新基準

如果你在蓋搜尋型 agent,最麻煩的問題之一是:怎麼知道搜尋這一層到底好不好?現在流行的 agentic search 評測,根據 Exa 在 2026 年 10 月 8 日發表的 ATLAS 基準說明,多半已經被模型「背下來」了。Exa 的資料顯示,BrowseComp、WideSearch 和 DeepSearchQA 有接近一半或更多的題目,被至少一個前沿模型在純閉卷條件下答對;即使把搜尋品質嚴重砍掉,這些基準上的 agent 還能保留 81–89% 的分數。也就是說,你以為在測搜尋,其實在測記憶。

另一條路線像 Perplexity 的 WANDR,用 LLM judge 保持題目新鮮,但 Exa 指出評分成本極高(每十次完整評分 18,000 到 50,000 美元),而且對 grader 設計非常敏感,例如 grader 的網頁抓取工具用哪家 provider 都會影響結果。

ATLAS 怎麼設計

ATLAS(Agentic Tasks for Large Aggregation + Search)包含 547 個任務。每個任務從 Exa 匿名化的真實搜尋需求中取種子題,要求系統找出所有符合精確條件的實體(人、地點、公司等),再為每個實體補上 2 到 10 個多跳屬性。74% 的任務需要找出 10 個以上實體;根據 Exa 的建構日誌估計,完整的發現加富集平均要橫跨 18 個網域。

黃金答案由一組前沿模型委員會產生:兩個不同模型家族的 agent(Codex 搭 GPT-6 Astra、Claude Code 搭 Opus 5.5)獨立搜尋建表,每個任務中位數花 8 個 agent 小時、約 1,200 次搜尋,再逐項驗證並修復歧見。為了避免偏向任何一家搜尋索引,建構過程的搜尋透過一個中立工具進行,把 Exa、Brave 和 Perplexity 的結果交錯混合、隱藏來源。

因為整條管線是自動化的,資料集可以隨著近期搜尋趨勢重新生成,這是它相對於舊基準最實用的差異。

對 builder 的三個訊號

結果本身比排名更值得注意:

  • 沒有任何一次成本低於 1 美元的任務達到 0.5 以上的 row F1。
  • 最貴的搜尋 agent 仍漏掉約三分之一黃金結果,完整性導向的場景還有很大缺口。
  • 固定模型與 harness 後,不同搜尋後端之間分數差距達 16%,Exa 主張搜尋 API 本身就是 Pareto frontier 上的關鍵變數。

第三點和我之前寫過的方向一致:把 2.1 億個地點變成 agent 可直接用的結構化資料(/blog/exa-places-structured-data-agents/)時,搜尋層的品質直接決定 agent 上限。ATLAS 把這件事量化了——當 Exa 把每十筆搜尋結果的前七筆隱藏,同一個 agent 的 ATLAS 分數掉約一半。

一個務實的挑戰定義

ATLAS 給 builder 的挑戰很具體:在一分鐘內、低於 1 美元完成深度又廣度的搜尋任務。這其實是把「效率搜尋」變成可最佳化的目標。你選的搜尋後端、result 數量、重試策略,現在有一個可以反覆量測的分數了。

限制也要說清楚:這是 Exa 自己的基準,題目來自 Exa 的搜尋需求資料,偏向他們熟悉的聚合式、完整性導向任務。如果你的 agent 場景是單一事實查詢或在地化摘要,row F1 不見得是你該最佳化的指標。

參考來源

AGENTIC COMMONS由 PHLEGON LABS 經營
分享X電郵
支持我們

相關閱讀

  1. NVIDIA AVO 於 ARC-AGI-3 滿分:模型之外的代理系統才是關鍵

    NVIDIA 的 AVO 代理系統在互動推理基準 ARC-AGI-3 公開集拿到 100.00 RHAE、用 6,624 步解完 183 關,本文解析其監督者與持續記憶體設計,以及「模型不是整個代理」的意義。

    NVIDIA

  2. GPT-5.2 寫下 METR 時間視野新紀錄:6.6 小時的 Agent 門檻

    METR 於 2026 年 2 月 4 日將 GPT-5.2 納入時間視野追蹤:高推理模式的 50% 時間視野約 6.6 小時,刷新紀錄。本文解析指標計算方式、與前代模型對比,以及約每 4–7 個月翻倍的指數趨勢對工程團隊的意義。

    Agent Benchmarks

  3. 改了 prompt 或換了模型之後,你的 agent 需要一套鎖住的測試案例

    OpenRouter 在 2026 年 9 月 30 日的教學提出 agent 迴歸測試方法:鎖定案例集、寫下行為合約、換模型時只動一個變數。

    AI Agents