當你打造一個會回答學術問題的 AI agent,檢索層的選擇往往決定了答案是否可靠。模型可以推理得很好,但如果檢索層只給它標題和摘要,它就可能引用一篇根本不支持該論點的論文。這種失敗有幾種樣貌:錯誤歸因、幻覺的識別碼、偏離原文的改寫——共通點是 agent 被要求描述它從未真正看過的證據。
Firecrawl 在 2026 年 8 月 24 日發布的比較文章中,檢視了五種學術搜尋 API,並指出多數工具比較是為人類研究者寫的,而 agent 的需求截然不同。以下整理這些 API 的適用場景與取捨,供產品開發者參考。
Agent 需要的不是「搜尋結果頁」
人類可以快速掃過十個標題再點開有希望的論文,但 agent 無法這樣做——檢索層回傳什麼,答案就建立在什麼之上。因此,學術搜尋對 agent 而言必須提供三件事:
- 穩定的論文身份:規範的識別碼、標題、作者、日期,以欄位而非文字形式提供。
- 相關的內文證據:能回答問題的正文段落,而不只是摘要。
- 與相關工作的關聯:能從一篇論文移動到它引用的、引用它的、以及鄰近的論文。
這三項不必在一次呼叫中全部到位,但 agent 必須能取得身份、證據與關聯,而不必自己重建學術層。
一般搜尋端點擅長發現,但 agent 無法引用找到的內容;通用爬蟲能提供頁面內容與來源 URL,卻不會正規化學術特有的部分,如 DOI、arXiv ID、PMID、版本、跨來源的規範身份與引用關係。在 agent 迴圈中,這些工作會重複發生,因此內建這些能力的 API 能大幅減少開發負擔。
五種 API 的定位與取捨
Firecrawl 的文章將五種 API 依適用工作流分組,而非排名,因為目前沒有跨五者的基準測試。
Firecrawl Research Index 是專為 agent 工作流設計的檢索索引,2026 年 6 月推出,涵蓋超過 300 萬篇 arXiv 論文。它的讀取模式(read mode)是關鍵能力:對論文提出問題,回傳帶分數的正文段落,而非 PDF 連結。此外,它提供引用圖譜擴展(similar、citers、references),並有獨立的 Developer Index 處理 GitHub 議題、PR 與 README。Firecrawl 宣稱在 arXivQA 上達到 53.3% 的召回率(每次任務成本 $0.32),MRR 0.750,但這是供應商自行運行的基準,方法雖公開可重現,仍非獨立評估。
arXiv API 是免費且穩定的解析器,適合已知 arXiv ID 的直接查詢。它回傳乾淨的結構化元資料,但限制為每三秒一次請求、單一連線,且不提供全文或引用圖譜。對於新鮮度敏感的 agent,arXiv 只在週日到週四發布公告,週五收到的稿件可能要等到週日晚上。
Semantic Scholar 提供跨領域的廣泛涵蓋(2.14 億篇論文、24.9 億引用),支援前後向引用遍歷,並能從開放取用論文或摘要中回傳查詢匹配的片段。但它的即時 API 節奏未公布,匿名使用者共享每秒 1000 次請求,有金鑰則為每秒 1 次。
OpenAlex 是跨領域的綜合索引,擅長元資料與 DOI 解析,提供快取的全文內容,但沒有查詢排序的段落。它提供免費的公開快照(每季),API 無金鑰時每天 $0.10,有金鑰每天 $1,速率為每秒 100 次請求。
Exa 除了論文,也涵蓋灰色文獻(grey literature),其出版物索引加上網頁索引,回傳全文與高亮。網頁索引每小時更新,但出版物節奏未公布;搜尋端點為每秒 10 QPS,每千次請求 $7。
速率限制與新鮮度:2026 年變動最大的部分
Firecrawl 特別提醒,速率限制是 2026 年變動最多的部分。Agent 的兩跳引用追蹤可能在幾秒內發出數十次呼叫,若供應商在中途限流,就會得到看似完整但實際殘缺的答案。因此,在承諾使用某家供應商前,務必檢查最新的速率限制與計費方式。
新鮮度同樣關鍵。在快速發展的領域,預印本本身就是文獻,而非預覽。arXiv API 的公告排程、Semantic Scholar 的即時節奏未公布,這些都會影響 agent 回答的時效性。
實作範例:單跳檢索
以下 TypeScript 範例使用官方 firecrawl Node SDK(型別檢查以 firecrawl@4.32.0 為準),示範如何找到論文並取得回答問題的正文段落:
import { Firecrawl } from "firecrawl";
const firecrawl = new Firecrawl({
// Falls back to FIRECRAWL_API_KEY. Research works keyless at low volume.
apiKey: process.env.FIRECRAWL_API_KEY,
maxRetries: 3,
backoffFactor: 0.5,
});
const found = await firecrawl.research.searchPapers(
"detecting citation hallucination in retrieval augmented generation",
{ k: 5 },
);
for (const paper of found.results) {
console.log(paper.primaryId, paper.title);
}
五筆結果中的前三筆如下:
arxiv:2601.05866 FACTUM: Mechanistic Detection of Citation Hallucination in Long-Form RAG
arxiv:2605.27700 CiteCheck: Retrieval-Grounded Detection of LLM Citation Hallucinations in Scientific Text
arxiv:2603.27752 Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG
每筆結果同時帶有 paperId 與 primaryId(即 arXiv ID)。若要取得支援論點的段落,可對論文 ID 呼叫讀取模式並附上查詢問題:
const read = await firecrawl.research.readPaper(
"arxiv:2601.05866",
"What method does FACTUM use to detect citation hallucinations?",
);
console.log(read.passages[0].text);
務實的選擇建議
沒有單一 API 適合所有情境。若你的 agent 需要引用正文段落,Firecrawl Research Index 的讀取模式是首選,但要注意它的 AI/ML 語料庫不涵蓋經濟學或非 arXiv 期刊,且計費為點數制,較難預測。若只是解析已知的 arXiv ID,arXiv API 免費且穩定,但無法應付多步驟工作流。若需要跨領域的引用遍歷,Semantic Scholar 或 OpenAlex 更合適,但需接受其速率限制或缺乏段落排序。
Firecrawl 也提到,Aemon(YC W26)在內部基準中發現 Firecrawl Research 在科學與技術檢索系統中提供了最強的召回率,特別是在較深的搜尋深度。這類第三方驗證有助於決策,但仍需自行測試。
最後,別忘了 PDF 解析的「最後一哩路」。arXiv API 回傳 PDF 連結,你需要自行處理抽取;Firecrawl 的 /parse 端點則可將 PDF 轉為乾淨的 Markdown。選擇 API 時,一併考慮這個環節,能讓 agent 的引用真正可驗證。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
