עברית ב-GPT צורכת פי 1.56 יותר טוקנים מאנגלית

Jonhisking · 2026-10-01

תרגמנו את אותו פרומפט של שירות לקוחות ל-34 שפות וספרנו טוקנים עם o200k_base, הטוקנייזר הנוכחי של OpenAI ‏(GPT-4o ואילך). באנגלית נדרשים 34 טוקנים, בעברית 53 — פי 1.56, מקום 24 מתוך 34 (1 = הזול ביותר).

הגרסה העברית:

סכמו את המייל של הלקוח למטה בשלוש נקודות והציעו תשובה מנומסת. הלקוח אומר שההזמנה הגיעה באיחור של יומיים ושפריט אחד היה חסר בקופסה.

תוצאות

שפה טוקנים ביחס לאנגלית הטוקנייזר הישן של GPT-4
English 34 1.00× 1.00×
简体中文 35 1.03× 1.53×
Español 40 1.18× 1.29×
Deutsch 43 1.26× 1.50×
한국어 49 1.44× 2.50×
עברית 53 1.56× 3.76×
日本語 61 1.79× 2.21×
Čeština 68 2.00× 2.59×
Ελληνικά 70 2.06× 4.94×

תוצאות

למה

הטוקנייזר לומד בעיקר מטקסט באנגלית: מילים כמו " polite" או " customer" הן טוקן אחד, בעוד שמילים רבות בעברית, עם תחיליות וסיומות, מתפרקות לחלקים:

לעומת הטוקנייזר הישן

בטוקנייזר מתקופת GPT-4 ‏(cl100k) אותו פרומפט היה 3.76×, והיום 1.56× — פחות מחצי.

בכסף

במודל שעולה 2 דולר למיליון טוקני קלט, שליחת הפרומפט מיליון פעמים עולה 68 דולר באנגלית ו-106 דולר בעברית. אם גם התשובה בעברית, אותו מכפיל חל על טוקני הפלט, שעולים בדרך כלל פי 4–5.

איך לחסוך

מגבלות

התוצאות המלאות ל-34 שפות (באנגלית): השוואה של 34 שפות

מדדו את הטקסט שלכם: כמה טוקנים וכמה כסף עולה הפרומפט שלכם בעברית לעומת אנגלית.

פתיחת מונה הטוקנים →