Harness 核心 · 模型周围的 Harness

KV Cache:用空间换时间(和钱)

类比理解 + 节省效果计算器,拖动轮次查看节省比例

本页解决的问题

先给结论

「KV Cache:用空间换时间(和钱)」要解决的关键问题是什么?

类比理解 + 节省效果计算器,拖动轮次查看节省比例

判断标准

让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。

下一步

写下一个问题:试完这个方法后,你能用什么证据回答它?

常见误区

结论听起来很完整,却没有检查最关键的假设。

原理
类比:
无缓存 = 每次上课都从头默写所有课本
有缓存 = 课本拍好存档,今天只看今天的新笔记
无 KV Cache
每轮:System Prompt + 全部历史 全量重算

第 N 轮成本 = 第 1 到 N 轮所有 Token 之和
有 KV Cache
历史 Token 的 K/V 已缓存,只算本轮新 Token

第 N 轮成本 ≈ 本轮新增那几个 Token
逐轮对比演示
模式:
System Prompt
重复计算
缓存命中
新增计算
点击「下一轮」开始演示 · 每格 = 固定 token 量,SYS 始终不变
0
已演示轮次
0T
无缓存累计算量
0T
有缓存累计算量
节省比例
切换「无缓存 / 有缓存」对比两种模式效果
结论:对话轮次越多,KV Cache 节省越大。保持 System Prompt 不变是最简单、最有效的优化手段。
关键提醒
System Prompt 越长,KV Cache 越值钱。
5000 Token 的系统提示词,1000 轮对话后,KV Cache 节省约 80% 总成本。保持 System Prompt 不变 = 缓存命中。
⚠️ 隐藏大坑:分布式推理服务器
云端 LLM 通常跑在多台推理服务器上。你的请求可能每次被路由到不同节点,那台节点没有你的前文缓存,隐式缓存永远 MISS
下一课预告:显式缓存:一行代码保证命中,含 Claude / Qwen / OpenAI 代码示例与命中率模拟对比。

「逐轮对比演示」为什么要看操作

「类比理解 + 节省效果计算器,拖动轮次查看节省比例」把结构落到了一个具体动作。这里真正要比较的不是名词谁更高级,而是数据如何被放置,以及最常发生的操作需要走多远。

读懂结构,要同时看访问方式和变化方式

「类比理解 + 节省效果计算器,拖动轮次查看节省比例」揭示了一个容易被忽略的取舍:按位置读取、按键查找、从两端进出、插入新元素和遍历关系,适合的组织方式并不相同。一个结构在某个操作上很快,不代表它在所有操作上都快。

把规模和更新频率一起算进去

实践时可以把「类比理解 + 节省效果计算器,拖动轮次查看节省比例」当作边界提醒:先写下数据量、最常用的操作和允许的延迟,再看 AI 给出的结构是否真的匹配。

从「逐轮对比演示」走到「关键提醒」

「逐轮对比演示」先把问题落在「模式: 无缓存 有缓存 System Prompt 重复计算 缓存命中 新增计算 点击「下一轮」开始演示 · 每格 = 固定 token 量,SYS 始终不变 0 已演示轮次 0T 无缓存累计算量 0T 有缓存累计算量 — 节省比例 ▶ 下一轮 重置 切换「无缓存 / 有缓存」对比两种模式效果 结论: 对话轮次越多,KV Cache 节省越大。保持 System Prompt 不变是最简单、最有效的优化手段」上;到了「关键提醒」,讨论继续推进到「System Prompt 越长,KV Cache 越值钱。 5000 Token 的系统提示词,1000 轮对话后,KV Cache 节省约 80% 总成本。 保持 System Prompt 不变 = 缓存命中。 ⚠️ 隐藏大坑:分布式推理服务器 云端 LLM 通常跑在 多台推理服务器 上。你的请求可能每次被路由到不同节点,那台节点没有你的前文缓存, 隐式缓存永远 MISS 。 下一课预告: 显式缓存:一行代码保…」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

遇到一个新的数据结构时,不要从定义开始背。先写出最频繁的操作,再估计数据量和更新方式,最后检查结构是否让这三个条件同时成立。

  • 「逐轮对比演示」:模式: 无缓存 有缓存 System Prompt 重复计算 缓存命中 新增计算 点击「下一轮」开始演示 · 每格 = 固定 token 量,SYS 始终不变 0 已演示轮次 0T 无缓存累计算量 0T 有缓存累计算量 — 节省比例 ▶ 下一轮 重置 切换「无缓存 / 有缓存」对比两种模式效果 结论: 对话轮次越多,KV Cache 节省越大。保持 System Prompt 不变是最简单、最有效的优化手段
  • 「关键提醒」:System Prompt 越长,KV Cache 越值钱。 5000 Token 的系统提示词,1000 轮对话后,KV Cache 节省约 80% 总成本。 保持 System Prompt 不变 = 缓存命中。 ⚠️ 隐藏大坑:分布式推理服务器 云端 LLM 通常跑在 多台推理服务器 上。你的请求可能每次被路由到不同节点,那台节点没有你的前文缓存, 隐式缓存永远 MISS 。 下一课预告: 显式缓存:一行代码保…

最后的「最后把结论落到实践」把讨论落到「类比理解 + 节省效果计算器,拖动轮次查看节省比例」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 KV Cache:用空间换时间(和钱) 模型周围的 Harness
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助