ภาษาไทยใช้โทเค็นมากกว่าภาษาอังกฤษ 1.74 เท่าใน GPT
Jonhisking · 2026-10-01
เราแปลพรอมต์บริการลูกค้าเดียวกันเป็น 34 ภาษา แล้วนับโทเค็นด้วย o200k_base ซึ่งเป็นตัวตัดคำ (tokenizer) ปัจจุบันของ OpenAI (GPT-4o ขึ้นไป) ภาษาอังกฤษใช้ 34 โทเค็น ภาษาไทยใช้ 59 โทเค็น หรือ 1.74 เท่า อยู่อันดับ 27 จาก 34 (1 = ถูกที่สุด)
ฉบับภาษาไทย:
โปรดสรุปอีเมลของลูกค้าด้านล่างเป็นสามข้อและเสนอคำตอบที่สุภาพ ลูกค้าบอกว่าคำสั่งซื้อมาถึงช้าไปสองวันและมีสินค้าหายไปหนึ่งชิ้นจากกล่อง
ผลลัพธ์
| ภาษา | โทเค็น | เทียบกับภาษาอังกฤษ | tokenizer GPT-4 รุ่นเก่า |
|---|---|---|---|
| English | 34 | 1.00× | 1.00× |
| 简体中文 | 35 | 1.03× | 1.53× |
| Español | 40 | 1.18× | 1.29× |
| Deutsch | 43 | 1.26× | 1.50× |
| 한국어 | 49 | 1.44× | 2.50× |
| ไทย | 59 | 1.74× | 3.71× |
| 日本語 | 61 | 1.79× | 2.21× |
| Čeština | 68 | 2.00× | 2.59× |
| Ελληνικά | 70 | 2.06× | 4.94× |

ทำไม
tokenizer เรียนรู้จากข้อความภาษาอังกฤษเป็นหลัก คำอย่าง " polite" หรือ " customer" เป็นโทเค็นเดียว แต่ภาษาไทยที่ไม่เว้นวรรคระหว่างคำมักถูกตัดเป็นชิ้นเล็ก ๆ:
- โปรดสรุปอีเมลของลูกค้า →
โปร | ด | ส | รุ | ป | อ | ี | เม | ล | ของ | ลูก | ค้า· 12
เทียบกับ tokenizer รุ่นเก่า
ใน tokenizer ยุค GPT-4 (cl100k) พรอมต์เดียวกันใช้ 3.71× ตอนนี้เหลือ 1.74× ค่าใช้จ่ายลดลงกว่าครึ่ง
คิดเป็นเงิน
กับโมเดลราคา 2 ดอลลาร์ต่อ 1 ล้านโทเค็นขาเข้า การส่งพรอมต์นี้ 1 ล้านครั้งเป็นภาษาอังกฤษใช้ 68 ดอลลาร์ ภาษาไทยใช้ 118 ดอลลาร์ หากคำตอบเป็นภาษาไทยด้วย ตัวคูณเดียวกันจะมีผลกับโทเค็นขาออกซึ่งมักแพงกว่า 4–5 เท่า
วิธีประหยัด
- เขียน system prompt และคำสั่งที่ใช้ซ้ำเป็นภาษาอังกฤษ ให้เหลือภาษาไทยเฉพาะข้อความจากผู้ใช้
- ให้ขั้นตอนกลาง (จัดหมวดหมู่ ดึงข้อมูล เรียกเครื่องมือ) ตอบเป็นภาษาอังกฤษหรือ JSON และให้เฉพาะคำตอบสุดท้ายเป็นภาษาไทย
- ใช้ prompt caching กับส่วนของพรอมต์ที่คงที่
ข้อจำกัด
- วัดเพียงพรอมต์เดียว ข้อความอื่นอาจต่างได้ ±0.1–0.2
- Claude และ Gemini ใช้ tokenizer ต่างกัน ตัวเลขนี้ใช้กับโมเดลของ OpenAI เท่านั้น
- คำแปลมาจากการแปลด้วยเครื่องที่ตรวจทานแล้ว
ผลครบทั้ง 34 ภาษา (ภาษาอังกฤษ): เปรียบเทียบ 34 ภาษา
ลองวัดข้อความของคุณเอง: พรอมต์ภาษาไทยใช้โทเค็นและค่าใช้จ่ายมากกว่าภาษาอังกฤษเท่าไร
เปิดตัวนับโทเค็น →