週二,GPT-6 prompt 快取迎來升級;OpenAI 新增診斷資訊與明確的斷點,目的是在重複查詢時降低延遲並控制成本。
重點摘要
OpenAI 於週二為 GPT-6 新增明確的 prompt-cache 斷點與診斷資訊
Prompt 快取在多個請求共用長前綴時,會重複使用早期標記的運算結果,例如系統指令或冗長文件
診斷資訊會顯示開發者,請求的哪些部分命中或未命中快取
OpenAI 同一天推出 GPT-6 Sol 與 Luna,並跨越不同的費用階層
該公司在 9 月 22 日的貼文中詳述這些變更,作為回應透過前沿模型執行冗長、重複提示所帶來的費用。提示快取(prompt caching)會儲存提示的早期 token 已計算出的內部表示,這樣模型伺服器就不必在每次呼叫時重新處理。
當請求共用很長的前綴(例如系統指令或冗長文件)時,伺服器就能重複使用那部分計算。
OpenAI 表示,此更新加入了明確的分割點,讓開發者標示提示快取應該在哪裡切分,並提供診斷資訊以顯示請求的哪些部分命中或未命中快取。該公告與 GPT-6 Sol 與 Luna 兩款新的模型變體同日發布;公司當天也推出了這兩種新變體,將前沿能力拆分到不同的成本等級。
為什麼快取控制對 GPT-6 工作負載很重要
推論成本會隨處理的 token 數量而增加,而快取未命中則會迫使每一個提示 token 都必須進行完整重新處理。
對於每天傳送相同 5,000-token 系統提示數千次的應用而言,即使是些微的未命中率也會成為一項預算支出。
過去兩年裡,提示快取已在產業中全面推出,成為一種略顯生硬、幾乎隱身於開發者視野之外的自動工具。OpenAI 朝向讓開發者自行設定分割點(breakpoints)的做法,反映了更廣泛的產業轉向:讓建置者掌握推理(inference)成本的控制權,而不是把最佳化完全交由模型供應商;同時,競爭實驗室也在進行類似動作,因為代理式工作負載會反覆以共享內容呼叫模型。
另請閱讀:OpenAI 推出 GPT-6 SOL 與 Luna,並附上新的安全規則
一家名為 Parallel 的 AI 研究自動化公司表示,根據 OpenAI 自己的案例研究,GPT-6 Astra 讓它的代理能在一半時間內完成勞動市場數據的研究與彙整,且成本也只有過往模型的一半。這就是更好的快取命中率所希望能夠推廣的承諾:適用於高流量、重複提示的使用情境,包括客服機器人與編碼代理等,它們會反覆呼叫相同的工具。
但一次發表會的示範並非一般日常的節省情境;實際成果取決於真正的快取命中率,並且也取決於第三方工具是否能呈現這些診斷資訊。
目前仍不清楚節省的幅度有多少會真正落到較小型開發者身上,或是企業端的合約是否直接與公司談判;同時也不確定其他提供商是否會在託管式 GPT-6 部署中提供類似的控制項。
延伸閱讀:在發布時的季度成本上,對手模型被 Claude Opus 5.5 打敗