返回 文章 apply CMS 文章

GPT-6 提示缓存升级:更高命中率与全新诊断工具

GPT-6 提示缓存升级:更高命中率、新诊断工具与显式缓存控制,让持久化智能体更快更省。

GPT-6提示缓存OpenAI持久化智能体
成长分 / 100 72 综合收获、行动、留存与影响

GPT-6 提示缓存升级:更高命中率与全新诊断工具
为什么值得读了解 GPT-6 提示缓存系统的具体改进,包括 30 分钟窗口内复用共享前缀的折扣机制。

掌握新增的提示缓存仪表盘和诊断工具,用于监控命中率并排查未命中原因。

关键洞察
  1. GPT-6 使持久化智能体能够长时间处理复杂任务,应用会发出延续相同指令、工具定义和上下文的系列 API 请求。
  2. OpenAI 缓存共享上下文以复用计算,缩短响应时间,并为开发者提供高达 90% 的缓存输入 token 折扣。
  3. 新系统默认提供更高缓存命中率,并对 30 分钟窗口内复用的符合条件的共享前缀给予缓存折扣。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:4702

为 GPT‑6 提供更好的提示缓存

更高的缓存命中率,以及帮助持久化智能体运行更快、成本更低的新工具。

GPT‑6 使持久化智能体能够长时间处理复杂任务,从重构代码库到生成经过充分研究的文档和演示文稿。这些智能体背后的应用会发出一系列相互构建的 API 请求,通常延续着相同的指令、工具定义以及先前轮次的上下文。OpenAI 会缓存这些共享上下文,以便在多个请求之间复用计算,从而缩短响应时间,并为开发者提供高达 90% 的缓存输入 token 折扣。

随着 GPT‑6 系列的推出,我们发布了一套改进的提示缓存系统,默认提供更高的缓存命中率。我们现在对在 30 分钟窗口内复用的符合条件的共享前缀给予缓存折扣。我们还引入了新工具,帮助开发者监控缓存性能、诊断未命中情况,并选择要缓存多少提示内容。

新的 提示缓存仪表盘(在新窗口中打开) 会显示你的应用输入中有多少来自缓存。你可以跟踪一段时间内的命中率,并使用输入构成图表来比较已缓存和未缓存的 token。这些视图可帮助你发现缓存命中的下降,并评估应用变更如何影响缓存性能。

提示缓存仪表盘,显示缓存命中率、随时间变化的缓存性能以及输入 token 构成。

当你看到意外的缓存未命中时,可使用 提示缓存诊断工具(在新窗口中打开) 来了解发生了什么。将某个请求与最近的响应进行比较,以识别模型、工具、设置或输入中阻止复用的变化。受影响的估计 token 数量可帮助你评估影响规模,并决定如何优化你的集成以最大化缓存命中率。

{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}

选择要缓存的内容。 显式缓存断点让你选择要复用哪些提示前缀。更新后的提示缓存指南(在新窗口中打开)说明了如何使用它们、缓存前缀在多长时间内保持有效,以及工具和输入的变化如何影响复用。

在不破坏缓存的情况下调整推理强度。 在 GPT‑6 模型上,你现在可以在多次响应之间更改推理强度(在新窗口中打开),而不会破坏缓存。对于更难的任务提高强度,对于常规的后续跟进降低强度,方法是追加一个

configuration_update

同时保持请求级别的推理强度不变。这让你可以调整任务所需的推理量,同时保留可复用的上下文。在工具和指令变化时保留缓存。 随着你的智能体的工具使用需求发生变化,保持工具定义、模式和顺序稳定,以便更早的上下文保持可复用。使用 allowed_tools

使只有相关的工具可被调用,或者在不需要工具时将 tool_choice 设为 none,而不是移除定义。使用新的开发者消息在上下文末尾追加新指令,以覆盖较旧的指令。请参阅我们关于管理工具变更的指南(在新窗口中打开)

预热缓存以降低延迟。预热(在新窗口中打开)会提前准备已知上下文,以便请求到达时模型可以更快开始响应。例如,应用程序可以在启动期间预热共享指令、工具定义或参考资料,在用户提出第一个问题之前完成。这会将处理移出用户的等待时间。

这些可选控制建立在引擎的默认性能之上,帮助你根据自身工作负载定制缓存。

.提示缓存仪表板(在新窗口中打开)中监控缓存命中率。使用

.诊断工具(在新窗口中打开)调查意外的未命中。遵循

以改进你的设置,或__提示缓存指南__(在新窗口中打开)来审查你的代码、应用改进并衡量结果。使用 Codex(在新窗口中打开)

继续阅读

查看全部