GPT-6 的持久型 agent 可以連續工作數小時,但背後的 API 請求會不斷重複攜帶相同的指令、工具定義與上下文。OpenAI 原本就會快取這些共享前綴,以換取最高 90% 的快取輸入 token 折扣。現在,GPT-6 家族推出改良的快取系統,預設提高快取命中率,並提供新的監控與診斷工具,讓開發者不再只能被動接受快取表現。
先看懂快取命中率,再談優化
新的 Prompt Caching Dashboard 會顯示應用程式有多少輸入來自快取,並提供隨時間變化的命中率趨勢,以及快取與未快取 token 的組成圖。當你調整 prompt 結構或工具定義後,可以直接觀察命中率是否下滑,而不必等到帳單變貴才發現問題。
遇到非預期的 cache miss 時,診斷工具能比對請求與近期回應,找出是哪個環節造成無法重用——可能是模型、工具、設定或輸入內容改變。工具會回傳受影響的 token 數,例如:
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
這讓開發者能精準定位快取失效的原因,而不是盲目猜測。
三個主動控制點,把快取變成設計決策
除了監控,OpenAI 也提供三個可選控制,讓開發者能根據工作負載調整快取行為。
選擇要快取的前綴。 明確的 cache breakpoints 讓你能指定哪些 prompt 前綴要重用。更新後的快取指南說明如何使用 breakpoints、快取前綴的有效期限,以及工具與輸入變更如何影響重用。
調整 reasoning effort 而不破壞快取。 在 GPT-6 模型上,現在可以在回應之間改變 reasoning effort,而不會讓快取失效。做法是附加 configuration_update,同時保持請求層級的 reasoning effort 不變。這讓你能在困難任務提高推理量、在例行追問降低推理量,同時保留可重用的上下文。
工具與指令變更時維持快取。 當 agent 的工具需求改變時,保持工具定義、schema 與順序穩定,讓先前的上下文仍可重用。使用 allowed_tools 只讓相關工具可呼叫,或在不需要工具時將 tool_choice 設為 none,而不是直接移除定義。新的 developer messages 則讓你在上下文尾端附加新指令,以覆寫舊指令。
預熱快取,把延遲移出使用者等待時間
Prewarming 讓應用程式在啟動時就先準備好已知的共享指令、工具定義或參考資料,等使用者提出第一個問題時,模型可以更快開始回應。這把處理時間從使用者的等待中移出,對延遲敏感的 agent 應用特別有用。
從被動折扣到主動管理
過去,快取折扣是 OpenAI 平台自動提供的福利,開發者只能盡量讓 prompt 結構符合快取規則。現在,儀表板、診斷工具與可選控制讓快取成為一個可以量測、診斷與調整的工程參數。這與我們先前討論的 AgentCore runtime 改版 有相似的思路:把基礎設施的隱藏成本攤開,讓開發者能做出明確的取捨。
對產品團隊來說,下一步不是急著改寫所有 prompt,而是先打開儀表板,觀察目前應用的快取命中率基線,再針對最常出現的 cache miss 原因逐一調整。快取優化是一個持續的過程,而不是一次性的設定。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
