ภาษาไทยใช้โทเค็นมากกว่าภาษาอังกฤษ 1.74 เท่าใน GPT

Jonhisking · 2026-10-01

เราแปลพรอมต์บริการลูกค้าเดียวกันเป็น 34 ภาษา แล้วนับโทเค็นด้วย o200k_base ซึ่งเป็นตัวตัดคำ (tokenizer) ปัจจุบันของ OpenAI (GPT-4o ขึ้นไป) ภาษาอังกฤษใช้ 34 โทเค็น ภาษาไทยใช้ 59 โทเค็น หรือ 1.74 เท่า อยู่อันดับ 27 จาก 34 (1 = ถูกที่สุด)

ฉบับภาษาไทย:

โปรดสรุปอีเมลของลูกค้าด้านล่างเป็นสามข้อและเสนอคำตอบที่สุภาพ ลูกค้าบอกว่าคำสั่งซื้อมาถึงช้าไปสองวันและมีสินค้าหายไปหนึ่งชิ้นจากกล่อง

ผลลัพธ์

ภาษา โทเค็น เทียบกับภาษาอังกฤษ tokenizer GPT-4 รุ่นเก่า
English 34 1.00× 1.00×
简体中文 35 1.03× 1.53×
Español 40 1.18× 1.29×
Deutsch 43 1.26× 1.50×
한국어 49 1.44× 2.50×
ไทย 59 1.74× 3.71×
日本語 61 1.79× 2.21×
Čeština 68 2.00× 2.59×
Ελληνικά 70 2.06× 4.94×

ผลลัพธ์

ทำไม

tokenizer เรียนรู้จากข้อความภาษาอังกฤษเป็นหลัก คำอย่าง " polite" หรือ " customer" เป็นโทเค็นเดียว แต่ภาษาไทยที่ไม่เว้นวรรคระหว่างคำมักถูกตัดเป็นชิ้นเล็ก ๆ:

เทียบกับ tokenizer รุ่นเก่า

ใน tokenizer ยุค GPT-4 (cl100k) พรอมต์เดียวกันใช้ 3.71× ตอนนี้เหลือ 1.74× ค่าใช้จ่ายลดลงกว่าครึ่ง

คิดเป็นเงิน

กับโมเดลราคา 2 ดอลลาร์ต่อ 1 ล้านโทเค็นขาเข้า การส่งพรอมต์นี้ 1 ล้านครั้งเป็นภาษาอังกฤษใช้ 68 ดอลลาร์ ภาษาไทยใช้ 118 ดอลลาร์ หากคำตอบเป็นภาษาไทยด้วย ตัวคูณเดียวกันจะมีผลกับโทเค็นขาออกซึ่งมักแพงกว่า 4–5 เท่า

วิธีประหยัด

ข้อจำกัด

ผลครบทั้ง 34 ภาษา (ภาษาอังกฤษ): เปรียบเทียบ 34 ภาษา

ลองวัดข้อความของคุณเอง: พรอมต์ภาษาไทยใช้โทเค็นและค่าใช้จ่ายมากกว่าภาษาอังกฤษเท่าไร

เปิดตัวนับโทเค็น →