OpenAI 针对 GPT-6 系列推出增强版提示词缓存系统,默认带来更高命中率,并为30分钟内复用的前缀提供高达90%的Token折扣。新版本还配备专属仪表盘和诊断工具,助力开发者优化长任务智能体的性能与成本。
在执行代码重构、研报编写等复杂任务时,GPT-6 支持的长程 AI 智能体往往需要持续数小时的高频调用。这些多轮 API 请求通常共享相同的系统指令、工具定义和历史上下文。针对这一场景,OpenAI 全面升级了提示词缓存(Prompt Caching)机制,重用跨请求计算,在降低响应延迟的同时,最高可为开发者减免 90% 的缓存输入 Token 费用。
在 GPT-6 系列模型中,增强型缓存系统不仅默认提供更高的命中率,还将合格前缀的缓存复用窗口延长至 30 分钟。同时,OpenAI 还发布了一套全新工具,帮助开发者全方位监控缓存表现、排查未命中原因并自主配置缓存粒度。
新上线的提示词缓存仪表盘直观展示了应用输入中由缓存支撑的比例。开发者可追踪随时间变化的命中率,并通过输入构成图表对比已缓存与未缓存 Token,从而快速定位命中率下滑节点,评估架构调整对缓存效率的影响。
当遇到非预期的缓存穿透时,可通过提示词缓存诊断工具排查根因。该工具将当前请求与近期的响应进行对比,精准找出导致复用失效的模型配置、工具描述或提示词变动,并返回受影响的 Token 规模估算:
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
configuration_update 即可针对疑难步骤拉高算力、对常规交互降低算力,无需修改请求层级的推理配置,完整保留此前沉淀的缓存上下文。allowed_tools 限制调用范围,或将 tool_choice 置为 none,避免直接增删工具定义;若要更新指令,优先在上下文尾部追加开发者消息覆盖旧规则,具体可参考工具变更管理指南。免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断