Čeština v GPT stojí 2× víc tokenů než angličtina

Jonhisking · 30. 9. 2026

Přeložil jsem jeden běžný prompt do 34 jazyků a spočítal tokeny tokenizérem, který používají současné modely OpenAI (o200k_base, GPT-4o a novější). Čekal jsem, že nejhůř dopadne japonština nebo thajština. Na konci ale skončily evropské jazyky: dražší než čeština (2,00×) je jen řečtina (2,06×), stejně jako čeština vychází slovenština.

Prompt (anglicky 34 tokenů):

Shrňte níže uvedený e-mail zákazníka do tří bodů a navrhněte zdvořilou odpověď. Zákazník píše, že objednávka dorazila se dvoudenním zpožděním a v krabici chyběla jedna položka.

Jazyk Tokeny Oproti angličtině Starý GPT-4 tokenizér
Angličtina 34 1,00× 1,00×
Čínština (zjednodušená) 35 1,03× 1,53×
Němčina 43 1,26× 1,50×
Ruština 45 1,32× 2,15×
Korejština 49 1,44× 2,50×
Japonština 61 1,79× 2,21×
Polština 64 1,88× 2,12×
Ukrajinština 64 1,88× 3,15×
Čeština 68 2,00× 2,59×
Slovenština 68 2,00× 2,53×
Řečtina 70 2,06× 4,94×

Graf

Proč? Tokenizér zná celá anglická slova (" polite", " customer" = 1 token), ale česká slova skládá z kousků. Háčky a čárky často tvoří samostatný token:

Zajímavost: stejný text bez diakritiky má 60 tokenů místo 68 (o 12 % méně). Nedoporučuju to jako trik, kvalita odpovědí může utrpět, ale ukazuje to, kolik stojí háčky a čárky.

V penězích: model za 2 $ / 1M vstupních tokenů, prompt poslaný milionkrát: angličtina 68 $, čeština 136 $. A to jen vstup. Pokud model odpovídá česky, stejný násobek platí i pro výstupní tokeny, které bývají 4–5× dražší.

Co s tím:

Omezení: je to jeden prompt, u jiných textů se poměr může lišit o ±0,1–0,2. Claude a Gemini mají jiné tokenizéry, čísla platí jen pro modely OpenAI. Překlad je strojový, pokud v něm najdete chybu, přeměřím to.

Celé výsledky všech 34 jazyků (anglicky): srovnání 34 jazyků

Změřte si vlastní text: kolik tokenů a peněz stojí váš prompt v češtině oproti angličtině.

Otevřít počítadlo tokenů →