返回文章库

人工智能/深层解释

Token 是甚么?为甚么同一句话会消耗不同用量?

Token 不是字数;它是模型处理文字、程式、标点和对话历史时切出的片段。语言、格式、上下文和工具都会改变真正用量。

01 / 人工智能

Token 不是字,也不是字符

你可以把 token 想成模型搬运资讯时用的积木,而不是人类数字上的『一个字』。同一句意思,用中文、英文、程式码或表格写,积木数目可以完全不同。

常见英文词可能一块完成,罕见名字可能碎成数块;中文字符在不同 tokenizer 下亦可能一字一块或与相邻字符合并。肉眼相同长度,不代表模型收到相同数量。

你打一句『帮我改短』,背后可能带住成千上万个 tokens——因为模型还背着之前的对话、附件和工具结果。表面一句,后台一大袋。

你只打了一句『帮我改短』,系统可能同时带上整段对话、上载档案、搜寻结果和工具输出。表面很短,实际上下文已经坐满一张枱。

02 / 人工智能

切法是模型设计的一部分

Tokenizer 的词汇表由训练方法与资料分布形成。常见片段值得独立占一个位置,稀有片段则被拆细。

因此 token 数同时透露一种隐藏偏好:模型世界里,哪些语言和写法被视为常见单位。它不是中性的字数计。

所以悭用量的第一步不是同标点搏斗,而是问:这段旧资料真的还需要吗?

对香港公司而言,真正值得做的不是逐字悭,而是让每个流程只带需要的资料,善用快取,并在长任务中定期摘要。悭的是噪音,不是必要背景。

03 / 人工智能

同一句意思,价格可以不同

研究比较多语 tokenizer 时发现,同一资讯在不同语言可需要相差数倍 token。影响不只 API 帐单:更多 token 亦占用更多 context、增加处理步数,甚至令一段较早触及长度上限。

所谓「一百万 token」不是一百万字,更不是每种语言都得到相同内容容量。

有时删掉三页重复背景,比把句子改短十个字更有效。

每个模型的输入、快取输入和输出计价可以不同;工具和推理深度也会令一次工作消耗更多。不要用『大约几多字』直接估月费。

04 / 人工智能

空格、标点和格式也在收费

JSON 的括号和引号、程式码的缩排、表格分隔符、对话角色标记,全部可能占 token。你只看到一个短问题,系统可能同时送入安全规则、工具定义、聊天历史和检索文件。

输入框的字数只是帐单最可见的一角。

05 / 人工智能

输出通常比输入更昂贵

很多服务把输入、快取输入和输出分开计价。生成输出需要逐 token 解码,延迟也沿着答案长度累积。

要求「更详细」不只是风格选择;它会增加成本、等待和产生新错误的机会。最有效的节省往往不是把问题缩成暗号,而是移除重复上下文和不必要输出。

06 / 人工智能

最可靠的方法只有实测

英文常见的「一 token 约四字符」只是一个粗略估算,不能套到所有语言和模型。要知道真正用量,应用该模型相符的 tokenizer 计算实际 prompt,连系统讯息、历史、工具 schema 和预期输出一起测。

Token 的隐藏秘密是:你不是只为问题付费,也为整个对话舞台付费。

07 / 人工智能

成本通常藏在你没有当成内容的东西:聊天历史、工具结果、格式和重复指令。

你只打了一句『帮我改短』,系统可能同时带上整段对话、上载档案、搜寻结果和工具输出。表面很短,实际上下文已经坐满一张枱。

对香港公司而言,真正值得做的不是逐字悭,而是让每个流程只带需要的资料,善用快取,并在长任务中定期摘要。悭的是噪音,不是必要背景。

08 / 人工智能

Token 数字不是固定价钱

每个模型的输入、快取输入和输出计价可以不同;工具和推理深度也会令一次工作消耗更多。不要用『大约几多字』直接估月费。

最可靠的预算方法,是用几个真实工作样本量度:一份长文件、一个普通查询、一个需要工具的流程,分开看。

09 / 人工智能

读者最常问

中文一定比英文悭 token?
不可以一概而论;切分方式由 tokenizer 决定,还会受标点、混合语言和格式影响。

删除聊天历史有用吗?
如果工作不再需要旧内容,会减少上下文;但不要删掉仍然是决策依据的资料。

快取输入是甚么?
重用完全相同的前缀时,部分平台会以较低费率处理;实际规则要看你使用的产品和模型。

资料注脚

资料注脚

  1. platform.openai.com/tokenizer
  2. platform.openai.com/docs/guides/text

来源用来支持机制与限制;模型、产品及价格会更新,阅读时应以官方页面的版本和日期为准。

读到最后,没有推销。

这里只保留一个更准确的理解,不把好奇心变成销售漏斗。

WhatsApp 联系 Locke Lee