Amazon Bedrock

別再只看每百萬 token 報價:Amazon Bedrock 上的 OpenAI 模型該怎麼挑

AWS 的開源評測把「答對一題要多少錢」和「代理跑幾輪才答對」攤開來算,讓模型選擇回到工作負載本身。

別再只看每百萬 token 報價:Amazon Bedrock 上的 OpenAI 模型該怎麼挑 — 文章封面

多數團隊比較生成式 AI 模型的方式都一樣:每百萬 token 多少錢。這個數字印在每一張定價頁上,所以也就成了每一張試算表裡的數字。但正式環境的工作負載買的不是 token,而是結果——一張結掉的客服單、一份完成的研究簡報、一份正確的財務摘要。在定價頁與結果之間,藏著幾個被標價忽略的乘數:模型答對的頻率、它需要多少 token 才走到那裡,以及對代理型工作負載來說,它要跑幾輪,因為每一輪都會把持續長大的對話再送一次。

AWS Machine Learning Blog 在 2026 年 9 月 11 日發布的這篇評測正是針對這幾個乘數。他們用一個開源評測框架,比較 Amazon Bedrock 上的三個 OpenAI 模型(gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol),以及兩個在 OpenAI API 上常見的成本最佳化基準(gpt-5.4-mini、gpt-5.4-nano)。後兩者被選為「多數團隊現在的起點」,而不是同世代的對等比較對象。

把「答對一題多少錢」算出來

AWS 的做法是把模型在對與錯的嘗試上花掉的總額,除以它答對的題數,得到「一次正確答案的觀察成本」。在 AIME 數學競賽題上,sol 解出 75%,mini 是 37%;GPQA Diamond 是 68% 對 43%,MMLU-Pro 是 82% 對 59%。

真正有意思的是成本那一欄。luna 在原價(約為 mini 的 1.5 倍)時,就已經是每題正確答案便宜 25%,原因是關掉推理後它用的計費 token 比 mini 在預設值下更少。2026 年 7 月 30 日 Bedrock 上 GPT-5.6 Luna 與 Terra 降價(luna 降 80%、terra 降 20%)之後,AWS 記錄到的每題正確 AIME 成本是 luna 的 $0.0021 對 mini 的 $0.0139。

AWS 也提醒,結果檔目前用的價格假設是 luna 每百萬輸入/輸出 token $0.22/$1.32、terra $2.20/$13.20,實際上線前應以最新的 Bedrock 推論層級與區域定價頁為準。

代理的帳單由輪數決定

單次呼叫的定價看不到代理型工作負載的關鍵特性。AWS 的框架用 store: false 的客戶端管理歷史,每一輪都重送系統提示、先前的工具結果與對話上下文,所以每輪上下文大致線性成長,累計的計費輸入可能接近平方成長。

在 DeepSearchQA 的 50 題分層樣本上,mini 平均每題跑了 7.6 輪(多為重複搜尋迴圈),到最後它的輸入 token 量是 terra 的 2.3 倍(每題 114k 對 50k)。結果 terra 較高的 token 單價被更少輪數與更好品質抵銷:每個通過答案 $0.31,mini 是 $0.40,平均 F1 為 0.50 對 0.39。luna 則是每題輪數比 mini 少,每個通過答案 $0.05。nano 的名目 token 價更低,但 18% 的通過率讓它的觀察成本是 $0.07。

這裡的結論很直接:輪數效率是一個定價變數,而它在定價頁上完全看不見。如果你的代理會串接工具呼叫——研究、多跳查詢、迭代檢索——就該把軌跡成本跟單次呼叫成本一起量。這跟我們先前談前綴感知路由如何影響 KV cache 與延遲是同一個思路:帳單與延遲往往由架構決定,而不是由單價決定。

專業交付物:rubric 才是及格線

很多團隊出貨的是文件——合規簡報、財務計畫、照護流程——這裡的「正確」是一份評分規準,不是字串比對。AWS 跑了 GDPval 的 48 項任務切片,每項都由平均 14 年經驗的專業人士建立 rubric,加權分數達 70% 才算通過。

三個 gpt-5.6 設定的觀察分數都高於 mini 與 nano,差距最大的是法律、護理與財務建議類任務。luna 在 48 項中 31 項高於 mini、9 項較低、8 項持平,通過 27 項對 mini 的 20 項。降價後 luna 在這個樣本裡成本最低:每個通過交付物 $0.010,mini $0.030、nano $0.012,通過率 56% 對 42% 與 35%。

AWS 也標註了一個限制:輸出上限設在 8,192 token,導致 luna 6 項、terra 9 項、sol 7 項、nano 1 項交付物被截斷。放寬上限可能改善品質,也可能推高成本,兩者要一起測。

對產品團隊的實際意義

AWS 給的遷移判斷很樸素:高頻、低複雜、失敗成本低的任務,從 luna 開始;互動式應用且準確度重要時,先量 luna 並用你的 SLO 重測延遲;會串接工具呼叫的代理,同時量 luna 與 terra;品質有硬門檻的難題,才去看 sol。

有兩件事值得自己驗證。第一,Bedrock 上的模型是在關閉推理的設定下跑,OpenAI API 基準則用預設值,所以這是「實務部署設定」的比較,不是模型本質能力的受控估計。第二,樣本數介於 48 到 198 之間,差距小的時候只能當方向性參考。

最務實的下一步不是換模型,而是把評測框架跑在自己的任務上。先量出你的「一次正確結果」成本,再決定要不要動。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵