Τα ελληνικά στο GPT θέλουν 2,06× τα tokens των αγγλικών — από τις ακριβότερες ανάμεσα σε 41 γλώσσες
Jonhisking · 2026-10-01
Μεταφράσαμε το ίδιο prompt εξυπηρέτησης πελατών σε 41 γλώσσες και μετρήσαμε τα tokens με τον o200k_base, τον τρέχοντα tokenizer της OpenAI (GPT-4o και νεότερα). Τα αγγλικά θέλουν 34 tokens, τα ελληνικά 70 — δηλαδή 2,06×, θέση 40 από 41 (1 = το φθηνότερο). Από τις ευρωπαϊκές γλώσσες, τα ελληνικά βγήκαν τα ακριβότερα· μόνο τα παντζάμπι (2,44×) κοστίζουν περισσότερο.
Η ελληνική εκδοχή:
Συνοψίστε το παρακάτω email του πελάτη σε τρία σημεία και προτείνετε μια ευγενική απάντηση. Ο πελάτης λέει ότι η παραγγελία έφτασε με δύο ημέρες καθυστέρηση και ότι έλειπε ένα προϊόν από το κουτί.
Αποτελέσματα
| Γλώσσα | Tokens | Σε σχέση με τα αγγλικά | Παλιός tokenizer GPT-4 |
|---|---|---|---|
| English | 34 | 1,00× | 1,00× |
| 简体中文 | 35 | 1,03× | 1,53× |
| Español | 40 | 1,18× | 1,29× |
| Deutsch | 43 | 1,26× | 1,50× |
| 한국어 | 49 | 1,44× | 2,50× |
| हिन्दी | 51 | 1,50× | 4,59× |
| 日本語 | 61 | 1,79× | 2,21× |
| Čeština | 68 | 2,00× | 2,59× |
| Ελληνικά | 70 | 2,06× | 4,94× |
| ਪੰਜਾਬੀ | 83 | 2,44× | 7,41× |

Γιατί
Ο tokenizer μαθαίνει κυρίως από αγγλικό κείμενο: λέξεις όπως " polite" ή " customer" είναι ένα μόνο token, ενώ οι ελληνικές λέξεις — με άλλο αλφάβητο και τόνους — σπάνε σε πολλά κομμάτια:
- Συνοψίστε →
Συ | νο | ψ | ί | στε· 5 - καθυστέρηση →
καθ | υσ | τέ | ρηση· 4 - προτείνετε →
προ | τε | ίν | ετε· 4
Σε σχέση με τον παλιό tokenizer
Στον tokenizer της εποχής GPT-4 (cl100k) το ίδιο prompt κόστιζε 4,94×· σήμερα 2,06×. Το κόστος έπεσε κάτω από το μισό, αλλά τα ελληνικά παραμένουν στις τελευταίες θέσεις.
Σε χρήματα
Με μοντέλο που χρεώνει 2 $ ανά εκατομμύριο tokens εισόδου, η αποστολή αυτού του prompt ένα εκατομμύριο φορές κοστίζει 68 $ στα αγγλικά και 140 $ στα ελληνικά. Αν και η απάντηση είναι στα ελληνικά, ο ίδιος πολλαπλασιαστής ισχύει και για τα tokens εξόδου, που συνήθως κοστίζουν 4–5× περισσότερο.
Πώς να γλιτώσετε
- Γράψτε το system prompt και τις σταθερές οδηγίες στα αγγλικά· κρατήστε στα ελληνικά μόνο ό,τι γράφει ο χρήστης.
- Ζητήστε τα ενδιάμεσα βήματα (ταξινόμηση, εξαγωγή, κλήσεις εργαλείων) στα αγγλικά ή σε JSON και μόνο την τελική απάντηση στα ελληνικά.
- Χρησιμοποιήστε prompt caching για το σταθερό μέρος του prompt.
Περιορισμοί
- Μετρήθηκε ένα μόνο prompt· σε άλλα κείμενα ο λόγος μπορεί να διαφέρει κατά ±0,1–0,2.
- Τα Claude και Gemini έχουν άλλους tokenizers — τα νούμερα ισχύουν μόνο για μοντέλα της OpenAI.
- Η μετάφραση βασίζεται σε ελεγμένη μηχανική μετάφραση.
Όλα τα αποτελέσματα για 41 γλώσσες (στα αγγλικά): σύγκριση 41 γλωσσών
Μετρήστε το δικό σας κείμενο: πόσα tokens και πόσα χρήματα κοστίζει το prompt σας στα ελληνικά σε σχέση με τα αγγλικά.
Άνοιγμα μετρητή tokens →