繁體中文在 GPT 中比英文多用 35% Token(1.35×)

Jonhisking · 2026-10-01

我們把同一段客服提示詞翻成 34 種語言,用 OpenAI 目前的 o200k_base 分詞器(GPT-4o 以後的模型)計算 Token。英文需要 34 個 Token,繁體中文需要 46 個,是英文的 1.35×,在 34 種語言中排第 14 便宜。

繁體中文版本:

請用三個重點總結下面的客戶郵件,並建議一封禮貌的回覆。客戶說訂單晚到了兩天,而且箱子裡少了一件商品。

結果

語言 Token 相對英文 舊 GPT-4 分詞器
English 34 1.00× 1.00×
简体中文 35 1.03× 1.53×
Español 40 1.18× 1.29×
Deutsch 43 1.26× 1.50×
繁體中文 46 1.35× 2.12×
한국어 49 1.44× 2.50×
日本語 61 1.79× 2.21×
Čeština 68 2.00× 2.59×
Ελληνικά 70 2.06× 4.94×

結果

為什麼

分詞器主要以英文資料訓練,常見英文單字通常是 1 個 Token(" polite"、" customer")。繁體字的常用詞收錄得比簡體少,常被拆成單字:

與舊分詞器相比

在 GPT-4 時代的 cl100k 分詞器上,同一提示詞是英文的 2.12×,現在降到 1.35×。不過同樣內容的簡體中文只要 1.03×。

換算成費用

以輸入每 100 萬 Token 2 美元計,把這段提示詞送出 100 萬次:英文 $68,繁體中文 $92。若回答也用繁體中文,單價通常高 4–5 倍的輸出 Token 也會乘上同樣倍數。

省 Token 的方法

限制

全部 34 種語言的結果(英文):34 種語言比較

用你自己的文字測一測:中文提示詞比英文多多少 Token 和費用。

開啟 Token 計算器 →