العربية في GPT تستهلك 1.26× رموز الإنجليزية

Jonhisking · 2026-10-01

ترجمنا موجّه خدمة عملاء واحدًا إلى 34 لغة وعددنا الرموز (Tokens) بمُجزِّئ o200k_base الحالي من OpenAI (‏GPT-4o وما بعده). تحتاج الإنجليزية إلى 34 رمزًا، وتحتاج العربية إلى 43 رمزًا، أي 1.26× الإنجليزية، في المرتبة 8 من 34 (1 = الأرخص).

النسخة العربية:

لخّص رسالة العميل أدناه في ثلاث نقاط واقترح ردًا مهذبًا. يقول العميل إن الطلب وصل متأخرًا يومين وإن أحد المنتجات كان مفقودًا من الصندوق.

النتائج

اللغة الرموز مقارنة بالإنجليزية مُجزِّئ GPT-4 القديم
English 34 1.00× 1.00×
简体中文 35 1.03× 1.53×
Español 40 1.18× 1.29×
العربية 43 1.26× 3.03×
Deutsch 43 1.26× 1.50×
한국어 49 1.44× 2.50×
日本語 61 1.79× 2.21×
Čeština 68 2.00× 2.59×
Ελληνικά 70 2.06× 4.94×

النتائج

لماذا

يتعلّم المُجزِّئ غالبًا من نصوص إنجليزية، فكلمات مثل " polite" و" customer" رمز واحد، بينما تُقسَّم كلمات عربية كثيرة إلى أجزاء:

مقارنة بالمُجزِّئ القديم

في مُجزِّئ حقبة GPT-4 ‏(cl100k) كان الموجّه نفسه 3.03×، واليوم 1.26× فقط. العربية من أكثر اللغات استفادةً من التغيير.

بالمال

مع نموذج سعره 2 دولار لكل مليون رمز إدخال، يكلّف إرسال هذا الموجّه مليون مرة 68 دولارًا بالإنجليزية و86 دولارًا بالعربية. وإذا كان الرد بالعربية أيضًا، يُطبَّق المُضاعِف نفسه على رموز الإخراج الأغلى عادةً بـ4–5 مرات.

كيف توفّر

حدود القياس

النتائج الكاملة للغات الـ34 (بالإنجليزية): مقارنة 34 لغة

قِس نصك بنفسك: كم رمزًا وكم دولارًا يكلف موجّهك بالعربية مقارنة بالإنجليزية.

افتح عدّاد الرموز →