Bahasa Indonesia memakai 1,15× token bahasa Inggris di GPT

Jonhisking · 2026-10-01

Saya menerjemahkan prompt layanan pelanggan yang sama ke 34 bahasa dan menghitung token dengan o200k_base, tokenizer OpenAI saat ini (GPT-4o dan setelahnya). Bahasa Inggris butuh 34 token, bahasa Indonesia 39 token — 1,15× bahasa Inggris, peringkat 3 dari 34 (1 = paling murah).

Versi bahasa Indonesia:

Ringkas email pelanggan di bawah ini dalam tiga poin dan sarankan balasan yang sopan. Pelanggan mengatakan pesanan tiba dua hari terlambat dan satu barang hilang dari kotak.

Hasil

Bahasa Token Dibanding bahasa Inggris Tokenizer GPT-4 lama
English 34 1,00× 1,00×
简体中文 35 1,03× 1,53×
Bahasa Indonesia 39 1,15× 1,38×
Español 40 1,18× 1,29×
Deutsch 43 1,26× 1,50×
한국어 49 1,44× 2,50×
日本語 61 1,79× 2,21×
Čeština 68 2,00× 2,59×
Ελληνικά 70 2,06× 4,94×

Hasil

Mengapa

Tokenizer terutama belajar dari teks bahasa Inggris: kata seperti " polite" atau " customer" hanya satu token, sedangkan kata berimbuhan dalam bahasa Indonesia dipecah:

Dibanding tokenizer lama

Di tokenizer era GPT-4 (cl100k), prompt yang sama 1,38×; sekarang 1,15×. Bahasa Indonesia termasuk yang paling hemat setelah bahasa Inggris dan Mandarin.

Dalam uang

Dengan model seharga $2 per 1 juta token input, mengirim prompt ini 1 juta kali menghabiskan $68 dalam bahasa Inggris dan $78 dalam bahasa Indonesia. Jika jawabannya juga berbahasa Indonesia, pengali yang sama berlaku untuk token output yang biasanya 4–5× lebih mahal.

Cara berhemat

Batasan

Hasil lengkap 34 bahasa (dalam bahasa Inggris): perbandingan 34 bahasa

Ukur teks Anda sendiri: berapa token dan biaya prompt bahasa Indonesia Anda dibanding bahasa Inggris.

Buka penghitung token →