提示词和缓存的微妙关系
改一个字 System Prompt,整条 KV Cache 作废。怎么减少手抖的成本
本页解决的问题
先给结论「提示词和缓存的微妙关系」要解决的关键问题是什么?
改一个字 System Prompt,整条 KV Cache 作废。怎么减少手抖的成本
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
每次请求,系统会对 System Prompt 算一个指纹(hash)
每一秒时间不同 → 指纹不同 → 缓存永远命不中 → 每次都要从头算 → 成本翻倍。
这不只是时间戳的问题:任何动态内容插在 System Prompt 里都有同样效果。
切换 Skill 时 System 变了 → 缓存失效
System 永远不变 → 前缀缓存始终命中
缓存命中模拟器
假设 10 次请求中有 3 次切换了不同的 Skill。观察两种注入方式的缓存差异:
「指纹变了 = 缓存作废」为什么要看操作
「每一秒时间不同 → 指纹不同 → 缓存永远命不中 → 每次都要从头算 → 成本翻倍。」把结构落到了一个具体动作。这里真正要比较的不是名词谁更高级,而是数据如何被放置,以及最常发生的操作需要走多远。
读懂结构,要同时看访问方式和变化方式
「假设 10 次请求中有 3 次切换了不同的 Skill。观察两种注入方式的缓存差异」揭示了一个容易被忽略的取舍:按位置读取、按键查找、从两端进出、插入新元素和遍历关系,适合的组织方式并不相同。一个结构在某个操作上很快,不代表它在所有操作上都快。
把规模和更新频率一起算进去
实践时可以把「假设 10 次请求中有 3 次切换了不同的 Skill。观察两种注入方式的缓存差异」当作边界提醒:先写下数据量、最常用的操作和允许的延迟,再看 AI 给出的结构是否真的匹配。
从「指纹变了 = 缓存作废」走到「Skill 的注入方式也影响缓存」
「指纹变了 = 缓存作废」先把问题落在「每一秒时间不同 → 指纹不同 → 缓存永远命不中 → 每次都要从头算 → 成本翻倍。 这不只是时间戳的问题: 任何动态内容插在 System Prompt 里都有同样效果」上;到了「Skill 的注入方式也影响缓存」,讨论继续推进到「切换 Skill 时 System 变了 → 缓存失效」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
遇到一个新的数据结构时,不要从定义开始背。先写出最频繁的操作,再估计数据量和更新方式,最后检查结构是否让这三个条件同时成立。
- 「指纹变了 = 缓存作废」:每一秒时间不同 → 指纹不同 → 缓存永远命不中 → 每次都要从头算 → 成本翻倍。 这不只是时间戳的问题: 任何动态内容插在 System Prompt 里都有同样效果
- 「Skill 的注入方式也影响缓存」:切换 Skill 时 System 变了 → 缓存失效
- 「模拟:10 次请求的缓存表现」:假设 10 次请求中有 3 次切换了不同的 Skill。观察两种注入方式的缓存差异
最后的「模拟:10 次请求的缓存表现」把讨论落到「假设 10 次请求中有 3 次切换了不同的 Skill。观察两种注入方式的缓存差异」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。