Coding agent 寫模型呼叫很快,但選模型靠的是訓練時記住的印象。新模型持續上線、價格隨時調整、benchmark 分數不斷刷新,半年前的「最強模型」今天可能又貴又被超越。OpenRouter 在 6 月 25 日發布的 MCP server,把這件事從記憶問題變成查詢問題:agent 直接讀 live model data、benchmark 排名、pricing 與文件,甚至對候選模型發測試 prompt。
選模型為什麼需要即時資料
模型選型最大的隱性成本,是決策依據的時效。訓練資料有截止日,模型市場沒有:一個 context window 擴充、一次降價、一家供應商調整 routing,都會讓上個月合理的結論失效。傳統做法是開瀏覽器查文件,但這個動作發生在人身上,不在 agent 的流程裡。
這個 MCP server 的設計意圖正是把查詢權交給 agent。它對外提供一個 remote endpoint(https://mcp.openrouter.ai/mcp),本地零安裝,任何支援 MCP 的 client 都用同一個位址接入。agent 取得的是此刻的目錄狀態,而不是快照式的訓練記憶。
對工作流程的影響比「多幾個工具」更深。過去選型發生在 agent 之外:人查資料、人下結論、再把結論寫進 prompt。現在選型的中間步驟——過濾、比價、查規格——全部搬進 agent 的工具呼叫鏈,人只看最後的候選名單與測試結果。這也是為什麼它叫 development assistant:它改變的是探索的速度,不是決策的責任。
十一個工具,只有一個要錢
工具箱共有十一個,涵蓋四類工作:
| 類別 | 工具 | 用途 |
|---|---|---|
| 目錄查詢 | list-models、get-model、list-model-endpoints |
依條件過濾模型、讀單一模型規格、比較各 provider 的價格與延遲 |
| 排名與評測 | list-benchmarks、list-daily-model-rankings、list-app-rankings |
第三方評測、每日用量排名、應用分類排名 |
| 測試推論 | send-message、get-generation |
對任一模型發測試 prompt、查單次呼叫的成本與供應商 |
| 文件與帳務 | search-docs、get-credits、list-providers |
全文檢索 OpenRouter 文件、查餘額、列供應商 |
計費邊界很清楚:只有 send-message 會花錢,其餘十個都是 read-only 查詢。benchmark 來源是 Artificial Analysis 與 Design Arena,另外附上 OpenRouter 自家的用量排名;模型可以加 :online、:nitro、:floor、:free 後綴,分別對應連網搜尋、加速、最低價與免費變體。
最有殺傷力的是 send-message:agent 對候選模型發同一個 prompt,拿回 response、cost 與實際服務的 provider,可以並排比較再決定。search-docs 則讓 agent 自己查 API 文件,不必等人開瀏覽器。
三種環境的接入方式
三種主流環境都是一行等級的設定。Claude Code 用兩個指令:claude mcp add --transport http openrouter 加上 endpoint,再 claude mcp login openrouter 完成 OAuth。Codex CLI 同樣是兩個指令:codex mcp add openrouter --url https://mcp.openrouter.ai/mcp,再 codex mcp login openrouter。Cursor 則是在 ~/.cursor/mcp.json 的 mcpServers 區塊加入同一個 remote URL。
Claude Desktop 與 Web 比較麻煩:OpenRouter 還不在 connector directory 裡,需要手動新增 custom connector、貼上 remote URL、走完 OAuth。部分組織會停用 custom connector,這條路是否存在取決於管理政策——企業環境先問 IT 再試。
文中範例:從清單到測試的完整流程
官方說明給了一個可直接照做的範例。需求是「適合 structured JSON 抽取、輸入價格低、context 夠長」的模型:agent 先用 list-models 帶條件過濾,再用 list-benchmarks 交叉比對評測分數,最後落在 google/gemini-3-flash-preview——文中範例數據是每百萬 input token 0.10 美元、context 138k。接著用 send-message 發真正的測試 prompt,確認 structured output 的表現,而不是只看規格表就下單。
這個流程值得記住的不是結論,而是順序:先過濾、再評測、最後實測。規格與排名縮小候選,測試推論做最終裁決。並排比較也一樣:對三個候選發同一個 prompt,用 get-generation 查各自成本,決策就有了三個維度的證據——輸出品質、單次成本、實際服務的 provider。第三個維度常被忽略,但 routing 的穩定性與吞吐往往比帳面價格更能決定上線後的體驗。
安全邊界與計費
OAuth 授權產生的是專屬 key:七天效期、預設十美元 spend cap。key 與其他金鑰分離顯示在 dashboard 上,可以隨時 revoke,cap 也可以調整。這個預設值得肯定——它把「agent 拿到的鑰匙」縮成一張用完即丟的臨時卡。
但原則仍然成立:不要把主要生產金鑰交給 coding agent。測試呼叫走專屬 key、生產流量走正式 API,兩條路分開,出事時的爆炸半徑才可控。
定位:輔助選型,不取代 API
OpenRouter 自己把定位說得很直白:MCP server 是 coding agent 的開發輔助,應用程式的正式流量仍然應該直接呼叫 OpenRouter API。MVP 探索期用 MCP 查資料做實驗,進入 production 後把選定的模型與 routing 寫進程式碼,這才是正確的分界。
實務上可以給自己一條切換線:當選型從「哪個模型適合」變成「這個模型穩不穩」,就該離開 MCP、走 API 了。前者是探索,後者是可靠性問題——需要的不再是目錄查詢,而是你自己的監控、重試與成本帳本。
另一個要自己把關的是 benchmark 的解釋權。Artificial Analysis 與 Design Arena 的分數是公開工作負載的答案,不等於你的任務分佈。把自家測試集留著,用成本、格式遵循率與錯誤率一起比較——MCP 給的是候選名單,最後一票仍在你手裡。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
