文章目录+
01 / 人工智能
Token 不是字,也不是字符
常见英文词可能一块完成,罕见名字可能碎成数块;中文字符在不同 tokenizer 下亦可能一字一块或与相邻字符合并。肉眼相同长度,不代表模型收到相同数量。
你打一句『帮我改短』,背后可能带住成千上万个 tokens——因为模型还背着之前的对话、附件和工具结果。表面一句,后台一大袋。
你只打了一句『帮我改短』,系统可能同时带上整段对话、上载档案、搜寻结果和工具输出。表面很短,实际上下文已经坐满一张枱。
02 / 人工智能
切法是模型设计的一部分
Tokenizer 的词汇表由训练方法与资料分布形成。常见片段值得独立占一个位置,稀有片段则被拆细。
因此 token 数同时透露一种隐藏偏好:模型世界里,哪些语言和写法被视为常见单位。它不是中性的字数计。
所以悭用量的第一步不是同标点搏斗,而是问:这段旧资料真的还需要吗?
对香港公司而言,真正值得做的不是逐字悭,而是让每个流程只带需要的资料,善用快取,并在长任务中定期摘要。悭的是噪音,不是必要背景。
03 / 人工智能
同一句意思,价格可以不同
研究比较多语 tokenizer 时发现,同一资讯在不同语言可需要相差数倍 token。影响不只 API 帐单:更多 token 亦占用更多 context、增加处理步数,甚至令一段较早触及长度上限。
所谓「一百万 token」不是一百万字,更不是每种语言都得到相同内容容量。
有时删掉三页重复背景,比把句子改短十个字更有效。
每个模型的输入、快取输入和输出计价可以不同;工具和推理深度也会令一次工作消耗更多。不要用『大约几多字』直接估月费。
04 / 人工智能
空格、标点和格式也在收费
JSON 的括号和引号、程式码的缩排、表格分隔符、对话角色标记,全部可能占 token。你只看到一个短问题,系统可能同时送入安全规则、工具定义、聊天历史和检索文件。
输入框的字数只是帐单最可见的一角。
05 / 人工智能
输出通常比输入更昂贵
很多服务把输入、快取输入和输出分开计价。生成输出需要逐 token 解码,延迟也沿着答案长度累积。
要求「更详细」不只是风格选择;它会增加成本、等待和产生新错误的机会。最有效的节省往往不是把问题缩成暗号,而是移除重复上下文和不必要输出。
06 / 人工智能
最可靠的方法只有实测
英文常见的「一 token 约四字符」只是一个粗略估算,不能套到所有语言和模型。要知道真正用量,应用该模型相符的 tokenizer 计算实际 prompt,连系统讯息、历史、工具 schema 和预期输出一起测。
Token 的隐藏秘密是:你不是只为问题付费,也为整个对话舞台付费。
07 / 人工智能
成本通常藏在你没有当成内容的东西:聊天历史、工具结果、格式和重复指令。
你只打了一句『帮我改短』,系统可能同时带上整段对话、上载档案、搜寻结果和工具输出。表面很短,实际上下文已经坐满一张枱。
对香港公司而言,真正值得做的不是逐字悭,而是让每个流程只带需要的资料,善用快取,并在长任务中定期摘要。悭的是噪音,不是必要背景。
08 / 人工智能
Token 数字不是固定价钱
每个模型的输入、快取输入和输出计价可以不同;工具和推理深度也会令一次工作消耗更多。不要用『大约几多字』直接估月费。
最可靠的预算方法,是用几个真实工作样本量度:一份长文件、一个普通查询、一个需要工具的流程,分开看。
09 / 人工智能
读者最常问
中文一定比英文悭 token?
不可以一概而论;切分方式由 tokenizer 决定,还会受标点、混合语言和格式影响。
删除聊天历史有用吗?
如果工作不再需要旧内容,会减少上下文;但不要删掉仍然是决策依据的资料。
快取输入是甚么?
重用完全相同的前缀时,部分平台会以较低费率处理;实际规则要看你使用的产品和模型。
资料注脚
资料注脚
来源用来支持机制与限制;模型、产品及价格会更新,阅读时应以官方页面的版本和日期为准。