返回文章庫

人工智能/深層解釋

Token 是甚麼?為甚麼同一句話會消耗不同用量?

Token 不是字數;它是模型處理文字、程式、標點和對話歷史時切出的片段。語言、格式、上下文和工具都會改變真正用量。

01 / 人工智能

Token 不是字,也不是字符

你可以把 token 想成模型搬運資訊時用的積木,而不是人類數字上的『一個字』。同一句意思,用中文、英文、程式碼或表格寫,積木數目可以完全不同。

常見英文詞可能一塊完成,罕見名字可能碎成數塊;中文字符在不同 tokenizer 下亦可能一字一塊或與相鄰字符合併。肉眼相同長度,不代表模型收到相同數量。

你打一句『幫我改短』,背後可能帶住成千上萬個 tokens——因為模型還背着之前的對話、附件和工具結果。表面一句,後台一大袋。

你只打了一句『幫我改短』,系統可能同時帶上整段對話、上載檔案、搜尋結果和工具輸出。表面很短,實際上下文已經坐滿一張枱。

02 / 人工智能

切法是模型設計的一部分

Tokenizer 的詞彙表由訓練方法與資料分布形成。常見片段值得獨立佔一個位置,稀有片段則被拆細。

因此 token 數同時透露一種隱藏偏好:模型世界裏,哪些語言和寫法被視為常見單位。它不是中性的字數計。

所以慳用量的第一步不是同標點搏鬥,而是問:這段舊資料真的還需要嗎?

對香港公司而言,真正值得做的不是逐字慳,而是讓每個流程只帶需要的資料,善用快取,並在長任務中定期摘要。慳的是噪音,不是必要背景。

03 / 人工智能

同一句意思,價格可以不同

研究比較多語 tokenizer 時發現,同一資訊在不同語言可需要相差數倍 token。影響不只 API 帳單:更多 token 亦佔用更多 context、增加處理步數,甚至令一段較早觸及長度上限。

所謂「一百萬 token」不是一百萬字,更不是每種語言都得到相同內容容量。

有時刪掉三頁重複背景,比把句子改短十個字更有效。

每個模型的輸入、快取輸入和輸出計價可以不同;工具和推理深度也會令一次工作消耗更多。不要用『大約幾多字』直接估月費。

04 / 人工智能

空格、標點和格式也在收費

JSON 的括號和引號、程式碼的縮排、表格分隔符、對話角色標記,全部可能佔 token。你只看到一個短問題,系統可能同時送入安全規則、工具定義、聊天歷史和檢索文件。

輸入框的字數只是帳單最可見的一角。

05 / 人工智能

輸出通常比輸入更昂貴

很多服務把輸入、快取輸入和輸出分開計價。生成輸出需要逐 token 解碼,延遲也沿着答案長度累積。

要求「更詳細」不只是風格選擇;它會增加成本、等待和產生新錯誤的機會。最有效的節省往往不是把問題縮成暗號,而是移除重複上下文和不必要輸出。

06 / 人工智能

最可靠的方法只有實測

英文常見的「一 token 約四字符」只是一個粗略估算,不能套到所有語言和模型。要知道真正用量,應用該模型相符的 tokenizer 計算實際 prompt,連系統訊息、歷史、工具 schema 和預期輸出一起測。

Token 的隱藏秘密是:你不是只為問題付費,也為整個對話舞台付費。

07 / 人工智能

成本通常藏在你沒有當成內容的東西:聊天歷史、工具結果、格式和重複指令。

你只打了一句『幫我改短』,系統可能同時帶上整段對話、上載檔案、搜尋結果和工具輸出。表面很短,實際上下文已經坐滿一張枱。

對香港公司而言,真正值得做的不是逐字慳,而是讓每個流程只帶需要的資料,善用快取,並在長任務中定期摘要。慳的是噪音,不是必要背景。

08 / 人工智能

Token 數字不是固定價錢

每個模型的輸入、快取輸入和輸出計價可以不同;工具和推理深度也會令一次工作消耗更多。不要用『大約幾多字』直接估月費。

最可靠的預算方法,是用幾個真實工作樣本量度:一份長文件、一個普通查詢、一個需要工具的流程,分開看。

09 / 人工智能

讀者最常問

中文一定比英文慳 token?
唔可以一概而論;切分方式由 tokenizer 決定,還會受標點、混合語言和格式影響。

刪除聊天歷史有用嗎?
如果工作不再需要舊內容,會減少上下文;但不要刪掉仍然是決策依據的資料。

快取輸入是甚麼?
重用完全相同的前綴時,部分平台會以較低費率處理;實際規則要看你使用的產品和模型。

資料註腳

資料註腳

  1. platform.openai.com/tokenizer
  2. platform.openai.com/docs/guides/text

來源用來支持機制與限制;模型、產品及價格會更新,閱讀時應以官方頁面的版本和日期為準。

讀到最後,沒有推銷。

這裏只保留一個更準確的理解,不把好奇心變成銷售漏斗。

WhatsApp 聯絡 Locke Lee