AI-tokenszámláló
Tokenek, karakterek és API-költség valós időben — bármilyen nyelven.
Ugyanahhoz a szöveghez a magyar nagyjából 1.74× annyi tokent használ, mint az angol (a GPT o200k tokenizálóján mérve).
Mi az a token?
A token egy szövegdarab, amelyet egy AI-modell olvas. Angolul 1 token nagyjából 4 karakter vagy egy szó ¾ része.
Miért drágábbak más nyelvek?
A tokenizálókat főleg angol szövegen tanítják, ezért a magyar, a koreai, a japán és sok más nyelv ugyanarra a jelentésre több tokenre bomlik.
Privát marad a szövegem?
Igen. Minden helyben, a böngésződben fut. A szöveged soha nem kerül fel semmilyen szerverre.
Mennyivel több tokent használ a magyar, mint az angol?
A GPT o200k tokenizálóján a magyar nagyjából 1.74× annyi tokent használ, mint ugyanaz a szöveg angolul. A régi GPT-4 tokenizálónak 2.26× kellett; a 41 mért nyelv között az arány 1.03× (egyszerűsített kínai) és 2.44× (pandzsábi) között mozog.