零基础入门 · 先把 AI 的雾气拨开

Token 是体验背后的计价器

用交互分词器看清文本为什么按片段计费、输入和输出为什么都算,以及语言和格式如何改变总量。Token 素养同时连接成本、上下文和延迟。

本页解决的问题

先给结论

「Token 是体验背后的计价器」要解决的关键问题是什么?

用交互分词器看清文本为什么按片段计费、输入和输出为什么都算,以及语言和格式如何改变总量。Token 素养同时连接成本、上下文和延迟。

判断标准

Token 既是计费单位,也是设计约束。 统计产品真正发送的 Prompt,不要只统计你眼前看到的文字。包装、重复历史和冗长输出都会在规模上叠加。

下一步

把一次真实请求拆成系统提示、历史、检索文本和输出分别测量。

常见误区

只根据用户可见的那句话估算成本。

一句话回答

Token 是 AI 读写文字的最小单位,大约是一小块词。AI 每读一颗、每写一颗都要消耗算力,所以按颗收费,逻辑和出租车按里程计价一样:跑多远,付多少。

亲手切一句话

下面有几句现成的话,点一句试试。你会看到它被切成一颗颗彩色的小块,每一块就是一颗 Token,下方的计数器和账单会实时跟着跳。

点上面任意一句,看它被切成一颗颗 Token
0
字符数
0
Token 数
0 厘
这句话的读取费(演示)
切分是 GPT-4o 家族分词表(o200k)的真实结果,换别的模型切法会不同。注意它不按人的语感来:「今天天气」会被切成「今 | 天天 | 气」。账单按演示费率「每千颗 Token 约 2 厘钱」估算,只用来感受量级。
为什么要按 Token 收费

出租车按里程计价,因为车每跑一公里都实打实地烧油。AI 同理:每读一颗、每吐一颗 Token,机房里的显卡都在做一轮运算、耗一份电。按颗数收费,是最贴近真实成本的计法。而且要注意,账单是两头一起算的

你发给它的(输入)

你打的每一个字、贴进去的每一段资料,它都要一颗颗读进去。读,也要钱。

它回给你的(输出)

它写的每一个字也是一颗颗算出来的。写,同样要钱,而且单价通常更贵,因为「写」比「读」费劲。

所以贴一大段没用的资料让它读,或者放任它写一堆车轱辘话,两头都在烧钱提示词工程那一页讲过:提示词里的废话,最后都会被一颗一颗放大成账单。
中文更费,还是英文更费

用上面的分词器对比一下中文句和英文句:中文常常一到两个字就要占一颗 Token,英文一个不短的单词往往只占一颗。所以表达同样的意思,中文消耗的 Token 数常常更多。这和模型「认字」的习惯有关:它对英文见得多、切得熟,对汉字只能切得更碎。

常见误区:字数不等于 Token 数。数字、符号、生僻词会被切得特别碎,「#2049」这样一个编号就占了三颗;「今天天气真不错」七个字只要五颗。别拿字数直接估账单,量级会差不少。

「亲手切一句话」如何改变一次回答

「Token 是 AI 读写文字的最小单位 ,大约是一小块词。AI 每读一颗、每写一颗都要消耗算力,所以按颗收费, 逻辑和出租车按里程计价一样 :跑多远,付多少」说明,模型处理的不是我们眼中的“字数”,而是一段段 Token。Token 的切分方式会影响输入长度、上下文能放下多少内容,以及一次请求要花多少计算。

长度、信息量和上下文不是一回事

当「下面有几句现成的话,点一句试试。你会看到它被切成一颗颗彩色的小块,每一块就是一颗 Token,下方的计数器和账单会实时跟着跳」变长时,先要分清三件事:文字被切成多少 Token、哪些内容真正参与当前判断、以及旧内容是否已经超出上下文窗口。删掉重复说明通常比单纯把窗口开得更大更有效。

  • Token 是计费的颗粒 :AI 读写文字的最小单位,大约一小块词
  • 输入输出都算钱 :你发的要钱,它回的也要钱,后者通常更贵
  • 同样的意思,中文往往更费 :汉字被切得更碎,颗数更多

先保留会改变判断的内容

可以用「用上面的分词器对比一下中文句和英文句:中文常常一到两个字就要占一颗 Token,英文一个不短的单词往往只占一颗。所以表达同样的意思, 中文消耗的 Token 数常常更多 。这和模型「认字」的习惯有关:它对英文见得多、切得熟,对汉字只能切得更碎」做一次对照:保留同样的问题,分别删掉重复背景、压缩格式和移除无关历史,比较答案质量、延迟与 Token 数量。

从「亲手切一句话」走到「为什么要按 Token 收费」

「亲手切一句话」先把问题落在「下面有几句现成的话,点一句试试。你会看到它被切成一颗颗彩色的小块,每一块就是一颗 Token,下方的计数器和账单会实时跟着跳」上;到了「为什么要按 Token 收费」,讨论继续推进到「出租车按里程计价,因为车每跑一公里都实打实地烧油。AI 同理:每读一颗、每吐一颗 Token,机房里的显卡都在做一轮运算、耗一份电。按颗数收费,是最贴近真实成本的计法。而且要注意, 账单是两头一起算的」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

处理长文本时,先保留会改变结论的内容,再决定如何压缩格式和历史;上下文更长只有在新增信息真正有用时才值得付出代价。

  • 「亲手切一句话」:下面有几句现成的话,点一句试试。你会看到它被切成一颗颗彩色的小块,每一块就是一颗 Token,下方的计数器和账单会实时跟着跳
  • 「为什么要按 Token 收费」:出租车按里程计价,因为车每跑一公里都实打实地烧油。AI 同理:每读一颗、每吐一颗 Token,机房里的显卡都在做一轮运算、耗一份电。按颗数收费,是最贴近真实成本的计法。而且要注意, 账单是两头一起算的
  • 「最后的要点」:提示词写得精炼,就是在直接省钱 :每省一颗都是真金白银

最后的「最后的要点」把讨论落到「提示词写得精炼,就是在直接省钱 :每省一颗都是真金白银」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

✅ 这一页想和你分享的

  • Token 是计费的颗粒:AI 读写文字的最小单位,大约一小块词
  • 输入输出都算钱:你发的要钱,它回的也要钱,后者通常更贵
  • 同样的意思,中文往往更费:汉字被切得更碎,颗数更多
  • 提示词写得精炼,就是在直接省钱:每省一颗都是真金白银
标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 Token 是体验背后的计价器 先把 AI 的雾气拨开
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
LM
Leo Martin独立开发者
观点成本预算

把 Token 当成体验背后的预算后,我开始同时关注上下文长度和调用次数。以前只盯单次价格,真正贵的是用户连续操作时累积出来的部分。

文章讨论7 有帮助
NB
Nadia Brown内容策划
问题问题

面向非技术同事解释 Token 时,用“字数”做近似会不会误导?我想给团队一个能做预算的直觉,但不希望他们把两个概念完全等同。

文章讨论4 有帮助
DA
Diego Alvarez应用工程师
建议产品提示

如果输入框旁边能显示一个粗略的 Token 区间,并在接近上下文上限时提醒,用户会更早意识到为什么回答开始变短或变慢。

文章讨论3 有帮助