A magyar 1,74× annyi tokent használ a GPT-ben, mint az angol

Jonhisking · 2026-10-01

Ugyanazt az ügyfélszolgálati promptot lefordítottam 41 nyelvre, és a tokeneket az o200k_base-szel, az OpenAI jelenlegi tokenizálójával (GPT-4o és újabbak) számoltam meg. Angolul 34 token kell, magyarul 59 — ez 1,74× annyi, 41 nyelv közül a 30. helyen a legolcsóbbtól számítva.

A magyar változat:

Foglald össze az alábbi ügyfél-e-mailt három pontban, és javasolj egy udvarias választ. Az ügyfél azt írja, hogy a rendelés két nap késéssel érkezett, és egy termék hiányzott a dobozból.

Eredmények

Nyelv Tokenek Az angolhoz képest Régi GPT-4 tokenizáló
English 34 1,00× 1,00×
简体中文 35 1,03× 1,53×
Español 40 1,18× 1,29×
Deutsch 43 1,26× 1,50×
한국어 49 1,44× 2,50×
हिन्दी 51 1,50× 4,59×
Magyar 59 1,74× 2,26×
日本語 61 1,79× 2,21×
Čeština 68 2,00× 2,59×
Ελληνικά 70 2,06× 4,94×
ਪੰਜਾਬੀ 83 2,44× 7,41×

Eredmények

Miért

A tokenizáló főleg angol szövegből tanul: az olyan szavak, mint a " polite" vagy a " customer", egyetlen tokenek, a toldalékokkal hosszú magyar szavak viszont darabokra esnek:

A régi tokenizálóhoz képest

A GPT-4-korszak tokenizálóján (cl100k) ugyanez a prompt 2,26× volt, ma 1,74×.

Pénzben

Egy 1 millió bemeneti tokenenként 2 dolláros modellnél ezt a promptot egymilliószor elküldeni angolul 68 dollár, magyarul 118 dollár. Ha a válasz is magyarul jön, ugyanez a szorzó érvényes a kimeneti tokenekre, amelyek általában 4–5× drágábbak.

Hogyan spórolj

Korlátok

Mind a 41 nyelv eredménye (angolul): 41 nyelv összehasonlítása

Mérd meg a saját szövegedet: hány tokenbe és mennyi pénzbe kerül a magyar promptod az angolhoz képest.

Tokenszámláló megnyitása →