تتّبع كل مراجعة نموذج ومقارنة معيارية على هذه المدونة العملية الموضحة أدناه. ننشرها كي تحكم بنفسك على استنتاجاتنا — وتتحقق منها مقابل النصوص المصدرية التي نعرضها.
ماذا نُقيّم
نختبر نماذج الترجمة بالذكاء الاصطناعي المتاحة على BelinDoc على الأعمال التي يجلبها الناس فعلاً إلى مترجم المستندات، لا على قوائم تصنيف مجردة. تغطّي المقارنة المعيارية القياسية للنموذج حتى ثمانية سيناريوهات للمستندات، يستقصي كلٌّ منها نقطة ضعف محددة (تستخدم المراجعات الأقدم أو المركّزة عدداً أقل، وتذكر العدد الدقيق في المقال):
| السيناريو | الاتجاه | ما الذي يستقصيه |
|---|---|---|
| ملخّص أكاديمي | EN → ZH | المصطلحات المتخصصة، المبني للمجهول، السجل الرسمي |
| بند في عقد قانوني | EN → ZH | الجمل الطويلة المتداخلة، الدقة، اللغة القانونية |
| مستند تقني يتضمن شيفرة | EN → ZH | المعرّفات داخل العلامات المائلة الخلفية يجب أن تبقى دون ترجمة |
| نثر أدبي | ZH → EN | سجل ذو نكهة كلاسيكية، إيقاع، صور شعرية |
| حوار مانغا | JA → EN | السجل العامي، صوت الشخصية، أدوات نهاية الجملة |
| جدول Markdown | EN → ZH | بنية الجدول، رموز الأخطاء، الوحدات |
| اتساق المصطلحات في مستند طويل | EN → ZH | مصطلح متعدد المعاني يُترجم باتساق عبر الفقرات |
| تشويش OCR | EN → ZH | يحتوي المصدر على شوائب مسح ضوئي؛ على النموذج استعادة المقصود لا نسخ الأخطاء |
قدر الإمكان، نعيد استخدام النصوص المصدرية نفسها من الجولات السابقة، دون تغيير، كي يمكن مقارنة النتائج عبر الزمن لا فقط مقابل النماذج ضمن مراجعة واحدة.
تختبر كل جولة النماذج الرائدة الحالية جنباً إلى جنب في الحلبة ذاتها — على سبيل المثال، أحدث جيل من OpenAI وAnthropic وGoogle وDeepSeek، إلى جانب الجيل السابق للمقارنة.
كيف نضع الدرجات
- تُشغَّل كل خلية عدة مرات، ونأخذ الوسيط. فطلب API الواحد عرضة لتباين من جهة الخادم، والاستنتاج من عيّنة واحدة هو الطريق إلى نشر الصدفة على أنها نتيجة.
- تقييم مزدوج أعمى، والحكّام ليسوا متسابقين. تُجهَّل الترجمات المرشحة إلى A / B / C… (بترتيب يُخلط مستقلاً في كل جولة) وتُقيَّم من 1 إلى 5 على الأمانة والسلاسة والمصطلحات والأسلوب والتنسيق بواسطة حكَمين مستقلَّين من نماذج الذكاء الاصطناعي. لا يظهر أيٌّ من الحكَمين في قائمة المتسابقين — فترك نموذج يصحّح مخرجاته يُدخِل تحيّزاً.
| البُعد | ما الذي يقيسه |
|---|---|
| الأمانة | المعنى محفوظ؛ لا إغفال ولا اختلاق |
| السلاسة | صياغة طبيعية في اللغة الهدف |
| المصطلحات | مصطلحات متسقة ومعيارية في المجال |
| الأسلوب | مطابقة السجل والنبرة للنص الأصلي |
| التنسيق | الحفاظ على التخطيط والجداول والبنية |
كيف تُجمَّع الدرجات. الأبعاد الخمسة متساوية الوزن. لكل ترجمة نأخذ متوسط الأبعاد الخمسة لدى كل حكم، ثم نأخذ متوسط الحكَمين؛ ودرجة النموذج في سيناريو ما هي وسيط تشغيلاته المتكررة؛ ودرجته الإجمالية هي متوسط درجاته عبر السيناريوهات. والتكلفة لكل نقطة = تكلفة النموذج لكل طلب ÷ درجته الإجمالية.
كيف نُبقيها عادلة
- التعليمة نفسها لكل نموذج. يترجم جميع المرشحين وفق تعليمة واحدة متطابقة ومقتضبة، كي نقيس النموذج — لا هندسة التعليمات.
- علامات عمياء. يرى الحكّام الترجمات لا أسماء النماذج؛ وتُخلط العلامات مستقلاً لكل حكم.
- عرض النص المصدر. تنشر كل مراجعة النص الأصلي إلى جانب الترجمات المرشحة، كي تتحقق من درجاتنا مقابل المخرجات الفعلية لا أن تأخذها على الثقة.
ما يتجاوز الجودة
جودة الترجمة ليست القرار بأكمله، لذا تُسجّل كل جولة أيضاً زمن الاستجابة (الوقت اللازم لترجمة عيّنة نمطية) والتكلفة (بما في ذلك مقارنات التكلفة لكل نقطة) والحفاظ على التنسيق: هل تصمد الجداول والأعمدة والبنية في المخرجات، وهو ما يستقصيه سيناريوها جدول Markdown وتشويش OCR. ملاحظة: هذه اختبارات على مقاطع نصية لا مستندات كاملة؛ وقد يختلف السلوك على ملفات PDF الكبيرة متعددة الصفحات أو الممسوحة ضوئياً (انظر القيود).
البيانات وحفظ السجلات
يعرض كل مقال — لكل سيناريو — النص المصدر وترجمة كل نموذج والدرجات على مستوى كل بُعد، بحيث يمكن التحقق من أي نتيجة مقابل المخرجات الفعلية على الصفحة نفسها. وخلف ذلك، تُؤرشَف مجموعة الترجمات الخام كاملةً ودرجات الحكّام وبرامج التجميع داخلياً، وتُنقَل الأرقام في كل مقال مباشرةً من ذلك الأرشيف.
كم مرة نُحدّث
نُعيد تشغيل المراجعات عندما يصدر نموذج نسخة جديدة أو يَحطّ تحديث كبير، ونراجع المقالات المتأثرة بدل ترك أرقام قديمة قائمة. ويُظهر كل مقال تاريخ آخر تحديث كي تعرف مدى حداثة النتائج.
الاستقلالية التحريرية
- الإفصاح: BelinDoc هو منتجنا الخاص. ويظهر في هذه المقارنات لأنه يعمل على النماذج نفسها التي نختبرها.
- ننشر حيث نخسر. عندما يقدّم نموذج منافس، أو أداة من طرف ثالث، أداءً أفضل في سيناريو ما من الخيار الذي كنا سنوصي به، نقول ذلك — فالمراجعات لا تنفع إلا إن كانت صادقة بشأن المفاضلات.
- لا ننتقي العيّنات بما يجمّل نتيجة، ولا نعدّل الدرجات بعد الأمر.
القيود
- الحكّام نماذج ذكاء اصطناعي لا مترجمون بشر. حكّام نماذج الذكاء الاصطناعي موثوقون على نحو معقول في الأبعاد القابلة للتحقق كالأمانة والمصطلحات؛ عامل "الأسلوب" بمزيد من الحذر.
- تتباين مخرجات النموذج من تشغيل إلى آخر؛ وأخذ الوسيط عبر التكرارات يقلّل ذلك، لكن الدرجات تبقى نقطة مرجعية مدروسة لا ضماناً لكل مستند.
- تغطّي كل جولة مجموعة محدودة من السيناريوهات واتجاه لغة معلَناً — والنتائج القوية في مجال واحد لا تضمن مثلها في غيره.
أسئلة حول اختباراتنا؟ اتصل بنا.