OpenAI

GPT-6 快取改版:把快取命中率從黑箱變成可調參數

OpenAI 為 GPT-6 推出新快取儀表板、診斷工具與可選控制,讓開發者能主動管理快取命中率與成本。

GPT-6 快取改版:把快取命中率從黑箱變成可調參數 — 文章封面

GPT-6 的持久型 agent 可以連續工作數小時,但背後的 API 請求會不斷重複攜帶相同的指令、工具定義與上下文。OpenAI 原本就會快取這些共享前綴,以換取最高 90% 的快取輸入 token 折扣。現在,GPT-6 家族推出改良的快取系統,預設提高快取命中率,並提供新的監控與診斷工具,讓開發者不再只能被動接受快取表現。

先看懂快取命中率,再談優化

新的 Prompt Caching Dashboard 會顯示應用程式有多少輸入來自快取,並提供隨時間變化的命中率趨勢,以及快取與未快取 token 的組成圖。當你調整 prompt 結構或工具定義後,可以直接觀察命中率是否下滑,而不必等到帳單變貴才發現問題。

遇到非預期的 cache miss 時,診斷工具能比對請求與近期回應,找出是哪個環節造成無法重用——可能是模型、工具、設定或輸入內容改變。工具會回傳受影響的 token 數,例如:

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

這讓開發者能精準定位快取失效的原因,而不是盲目猜測。

三個主動控制點,把快取變成設計決策

除了監控,OpenAI 也提供三個可選控制,讓開發者能根據工作負載調整快取行為。

選擇要快取的前綴。 明確的 cache breakpoints 讓你能指定哪些 prompt 前綴要重用。更新後的快取指南說明如何使用 breakpoints、快取前綴的有效期限,以及工具與輸入變更如何影響重用。

調整 reasoning effort 而不破壞快取。 在 GPT-6 模型上,現在可以在回應之間改變 reasoning effort,而不會讓快取失效。做法是附加 configuration_update,同時保持請求層級的 reasoning effort 不變。這讓你能在困難任務提高推理量、在例行追問降低推理量,同時保留可重用的上下文。

工具與指令變更時維持快取。 當 agent 的工具需求改變時,保持工具定義、schema 與順序穩定,讓先前的上下文仍可重用。使用 allowed_tools 只讓相關工具可呼叫,或在不需要工具時將 tool_choice 設為 none,而不是直接移除定義。新的 developer messages 則讓你在上下文尾端附加新指令,以覆寫舊指令。

預熱快取,把延遲移出使用者等待時間

Prewarming 讓應用程式在啟動時就先準備好已知的共享指令、工具定義或參考資料,等使用者提出第一個問題時,模型可以更快開始回應。這把處理時間從使用者的等待中移出,對延遲敏感的 agent 應用特別有用。

從被動折扣到主動管理

過去,快取折扣是 OpenAI 平台自動提供的福利,開發者只能盡量讓 prompt 結構符合快取規則。現在,儀表板、診斷工具與可選控制讓快取成為一個可以量測、診斷與調整的工程參數。這與我們先前討論的 AgentCore runtime 改版 有相似的思路:把基礎設施的隱藏成本攤開,讓開發者能做出明確的取捨。

對產品團隊來說,下一步不是急著改寫所有 prompt,而是先打開儀表板,觀察目前應用的快取命中率基線,再針對最常出現的 cache miss 原因逐一調整。快取優化是一個持續的過程,而不是一次性的設定。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵