专题篇章 · Token 成本工程:让账算得过来

报价表速览与三大梯队

T0 旗舰 / T1 主力 / T2 走量怎么分工;光知道哪个贵不够,要盯住价格跳变的边界线

本页解决的问题

先给结论

「报价表速览与三大梯队」要解决的关键问题是什么?

T0 旗舰 / T1 主力 / T2 走量怎么分工;光知道哪个贵不够,要盯住价格跳变的边界线

判断标准

把成本看成形状,不是一个数字。 把一次请求拆成输入、输出、重试、工具和等待时间。使用量的形状,通常能告诉你是哪项设计选择最贵、哪里值得先改。

下一步

优化想象中的平均值之前,先测一次真实请求。

常见误区

调用便宜了,却悄悄增加了重试、延迟或人工复核。

报价表全景

下面是作者团队当时主要使用的模型定价(已折算折扣后,单位:元 / 百万 Token)。三列分别是非缓存输入、缓存输入、输出——注意缓存价普遍只有标准价的两成甚至更低,这个巨大的差价就是第 11 节 KV Cache 的伏笔。

模型档位输入(非缓存)输入(缓存)输出
GLM-4.6
(355B A32)
Input ≤32k · Output ≤20010.24
Input ≤32k · Output >2001.50.37
Input 32k–200k20.48
Qwen3-MaxInput 0–32k1.60.326.4
Input 32k–128k3.20.6412.8
Input 128k–252k4.80.9619.2
Qwen-Plus
(235B A30)
0–128k · 非思考0.40.081
0–128k · 思考模式0.40.084
Qwen-FlashInput 0–128k0.0750.0150.75
Input 128k–256k0.30.063
GLM-4.5V / 4.5-AirInput 0–32k103
Input 32k–64k206

红色数字是「跳档后」的价格。同一个模型内部,价格能差 2–3 倍——这些边界线是第 4、5、6 节的主角。

三大梯队
T0 · 旗舰

Qwen3-Max、GLM-4.6(长输出档)

输出昂贵,能力天花板。留给复杂推理、代码生成、多模型仲裁这类「答错了损失更大」的任务。

T1 · 主力

Qwen-Plus、GLM-4.5-Air

性价比均衡。日常对话、RAG 问答、摘要归纳的主力,大部分请求应该落在这一层。

T2 · 走量

Qwen-Flash

近乎免费(缓存输入 0.015 元/M)。数据清洗、意图分类、高频监控随便跑,也是给大模型「打下手」的最佳人选。

懂技术的人看模型参数,懂经营的人看定价阶梯。做 AI 工程,两个都要懂。
交互演练 · 这个任务该用哪个梯队

五个真实业务场景,选一个你认为最合适的梯队。原则:能用便宜的绝不用贵的,但答错代价大的别省。

本节要点

先分梯队再选型:T0 管难题、T1 管日常、T2 管走量。大部分成本事故是「用 T0 干 T2 的活」。

缓存价是标准价的 1/5 甚至更低。能不能吃到这个折扣,取决于你的架构设计(见第 11 节)。

同一模型内部价格能差 2–3 倍。跳档边界线(输出 200、输入 32k)比模型选型本身更值得盯。

内容来源:整理自作者团队内部分享《AI Token 降本增效策略分享》。表中为作者当时的折后协议价,各家牌价与折扣随时在变,选型前请核对 DeepSeek 定价、阿里云百炼与智谱开放平台的实时报价。

「报价表全景」的完整成本怎么算

「下面是作者团队当时主要使用的模型定价( 已折算折扣后 ,单位:元 / 百万 Token)。三列分别是非缓存输入、缓存输入、输出——注意缓存价普遍只有标准价的两成甚至更低,这个巨大的差价就是第 11 节 KV Cache 的伏笔」提醒我们,AI 成本不是单价乘一次调用这么简单。输入、输出、重试、工具调用、等待时间和人工收尾,会共同决定一次任务到底贵不贵。

先找出账单里不断重复的部分

「红色数字是「跳档后」的价格。同一个模型内部,价格能差 2–3 倍——这些边界线是第 4、5、6 节的主角」对应的关键变量通常是上下文是否每轮重复发送、输出是否过长、失败是否触发重试,以及每次调用是否真的带来有用结果。减少无效 Token 往往同时降低费用、延迟和并发压力。

便宜的单次调用可能换来更贵的全流程

以「同一模型内部价格能差 2–3 倍。」为起点做一张小表:输入、输出、重试、工具和人工复核分别花了什么,再比较优化前后的质量,避免只看某一项价格。

从「报价表全景」走到「三大梯队」

「报价表全景」先把问题落在「下面是作者团队当时主要使用的模型定价( 已折算折扣后 ,单位:元 / 百万 Token)。三列分别是非缓存输入、缓存输入、输出——注意缓存价普遍只有标准价的两成甚至更低,这个巨大的差价就是第 11 节 KV Cache 的伏笔」上;到了「三大梯队」,讨论继续推进到「输出昂贵,能力天花板。 留给复杂推理、代码生成、多模型仲裁这类「答错了损失更大」的任务」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

分析成本时,先画出完整交互,再找每轮重复的输入、无效输出和失败重试;单次调用便宜,并不代表整个任务便宜。

  • 「报价表全景」:下面是作者团队当时主要使用的模型定价( 已折算折扣后 ,单位:元 / 百万 Token)。三列分别是非缓存输入、缓存输入、输出——注意缓存价普遍只有标准价的两成甚至更低,这个巨大的差价就是第 11 节 KV Cache 的伏笔
  • 「三大梯队」:输出昂贵,能力天花板。 留给复杂推理、代码生成、多模型仲裁这类「答错了损失更大」的任务
  • 「最后的要点」:缓存价是标准价的 1/5 甚至更低。 能不能吃到这个折扣,取决于你的架构设计(见第 11 节)

最后的「最后的要点」把讨论落到「缓存价是标准价的 1/5 甚至更低。 能不能吃到这个折扣,取决于你的架构设计(见第 11 节)」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 报价表速览与三大梯队 Token 成本工程:让账算得过来
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助