兩個端點,兩套功能清單
2026 年 8 月 18 日,xAI 的 Grok 4.6 在 Amazon Bedrock 上線;AWS 在 9 月 21 日的公告中把它定位為 frontier model,主打長時間執行的 agent、coding 與知識工作。這是 xAI 在 Bedrock 的第二個模型,但打包方式跟 Grok 4.3 那一次明顯不同。
最需要先看清楚的是:Grok 4.6 同時掛在 bedrock-mantle 與 bedrock-runtime 兩個端點,而兩邊支援的功能並不一樣。這不是「多一個入口」那麼簡單,而是會直接決定你之後能加什麼、不能加什麼。
你要 structured output,還是 Converse 與日誌
根據 AWS 的公告,bedrock-mantle 支援 client-side tool calling、reasoning、structured outputs、prompt caching、response streaming 等;bedrock-runtime 則支援 reasoning、prompt caching、response streaming、invocation logs,但不支援 structured outputs、server-side tool use、intelligent prompt routing、count tokens 與 application inference profiles。
選擇因此變得很具體。如果你的應用依賴 JSON Schema structured output,那條路指向 mantle。如果你要的是 Converse API(含 converse_stream)或把請求與回應寫進 CloudWatch 的 invocation logging,那就得走 runtime。公告也提到 Invoke API 不支援,這點在改寫既有程式碼時要先確認。
Tool calling 兩邊都能用:模型回傳結構化的 function request,你的程式執行後把結果送回去。差別在於 runtime 上可以透過 Converse 的 toolConfig 或 OpenAI 相容的 tools 參數驅動這個迴圈。
跨區域推論改變了容量與資料邊界的算法
Grok 4.3 當時只有 in-Region inference,沒有 Geo 與 Global 跨區域選項。Grok 4.6 在 runtime 上反過來:不提供 in-Region,只能透過 inference profile 呼叫。us.xai.grok-4.6 把流量留在美國地理範圍內,global.xai.grok-4.6 則在全球路由,容量池最大,價格也較低(每百萬 input token 2.00 美元對 2.20 美元)。沒有資料落地限制時,Global 通常是較合理的預設值。
這類「先確認路由與計價單位」的功課,跟我們先前在把 Kimi K3 放進 Bedrock 之後談長脈絡工作流時遇到的問題是同一類:模型能力只是其中一項,成本與資料邊界往往更早決定架構。
推理強度、快取與護欄怎麼影響帳單
Grok 4.6 提供四段 reasoning effort:low、medium、high、xhigh。xhigh 是這一代新增的檔位,在 Converse 上要用 additionalModelRequestFields={"reasoning_effort": "xhigh"} 設定,而不是一般的 reasoning 參數。公告的說法是,這適合「值得多花 token 換更深一層處理」的問題。
Prompt caching 的快取 input 約以標準費率的四分之一計價,對每輪都重送大型 system prompt 或文件的 agent 很有感。實作上有兩個細節:重複的前綴要放在請求最前面,並且要從 usage 區塊讀取 cached token 數,確認折扣真的發生,再把它寫進成本模型。
Bedrock Guardrails 這次也支援 runtime 上的 Grok 4.6,涵蓋內容過濾、拒絕主題、PII 遮蔽與字詞政策,政策同時套用在 prompt 與模型回應上。對可能無人看管、連續跑很多步的 agent 來說,這是把政策邊界固定住的方式。
分數怎麼讀,以及還沒確定的事
xAI 公布 Grok 4.6 High 在 8 月 12 日的一系列數字,包括 AA Intelligence Index 61、CursorBench v3.2 69.9%、Terminal-Bench v3.0 26%、APEX-Agents 57.5%。其中多項來自 Artificial Analysis,而該機構的 Intelligence Index 是九項評估的複合指標。這些是 xAI 自行發布的結果,不是獨立驗證。
對產品團隊來說,比較實際的做法是先確認三件事:你的整合需要 structured output 還是 Converse;你的資料能不能走 Global 路由;以及你的 agent 每輪重送多少前綴。這三題的答案會比任何一個 benchmark 分數更早決定成本與可行性。
另外,公告提到 Grok 4.6 接受文字與圖片輸入、輸出文字,不支援語音、影片與 embedding,也不生成圖片。至於公告中被截斷的 Flex 與 Priority 完整費率,以及各區域的即時可用清單,仍要以 Bedrock 定價頁與區域相容性文件為準。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
