Gumagamit ang Filipino ng 1.53× na token kumpara sa English sa GPT

Jonhisking · 2026-10-01

Isinalin ko ang parehong customer-support prompt sa 34 wika at binilang ang token gamit ang o200k_base, ang kasalukuyang tokenizer ng OpenAI (GPT-4o at mas bago). Sa English, 34 token; sa Filipino, 52 token — 1.53× ng English, ika-22 sa 34 (1 = pinakamura).

Ang bersyong Filipino:

Ibuod ang email ng customer sa ibaba sa tatlong punto at magmungkahi ng magalang na sagot. Sinabi ng customer na dumating ang order nang dalawang araw na huli at may isang item na kulang sa kahon.

Mga resulta

Wika Token Kumpara sa English Lumang GPT-4 tokenizer
English 34 1.00× 1.00×
简体中文 35 1.03× 1.53×
Español 40 1.18× 1.29×
Deutsch 43 1.26× 1.50×
한국어 49 1.44× 2.50×
Filipino 52 1.53× 1.76×
日本語 61 1.79× 2.21×
Čeština 68 2.00× 2.59×
Ελληνικά 70 2.06× 4.94×

Mga resulta

Bakit

Karamihang natututo ang tokenizer mula sa English na text: isang token lang ang mga salitang tulad ng " polite" o " customer", pero hinahati-hati ang maraming salitang Filipino na may panlapi:

Kumpara sa lumang tokenizer

Sa tokenizer ng panahon ng GPT-4 (cl100k), 1.76× ang parehong prompt; ngayon 1.53×.

Sa pera

Sa model na $2 bawat 1 milyong input token, ang pagpapadala ng prompt na ito nang 1 milyong beses ay $68 sa English at $104 sa Filipino. Kung Filipino rin ang sagot, parehong multiplier ang tatama sa output token, na kadalasang 4–5× na mas mahal.

Paano makatipid

Mga limitasyon

Buong resulta ng 34 wika (sa English): paghahambing ng 34 wika

Sukatin ang sarili mong text: ilang token at magkano ang prompt mo sa Filipino kumpara sa English.

Buksan ang token counter →