Belin Doc IconBelin Doc

Comment nous testons la traduction IA

BelinDoc Team2026/07/22

La méthodologie derrière chaque test et benchmark de modèle sur le blog BelinDoc : les scénarios de documents évalués, la notation par double juge LLM en aveugle, les runs répétés et la façon dont nous gardons des résultats honnêtes et à jour.

Chaque test et benchmark de modèle sur ce blog suit le processus décrit ci‑dessous. Nous le publions pour que vous puissiez juger nos conclusions par vous‑même — et les vérifier face aux textes sources que nous montrons.

Ce que nous évaluons

Nous testons les modèles de traduction IA disponibles sur BelinDoc sur les documents que les gens confient réellement à un traducteur de documents, et non sur des classements abstraits. Un benchmark de modèle standard couvre jusqu'à huit scénarios de documents, chacun sondant une faiblesse précise (les tests plus anciens ou ciblés en utilisent moins et précisent le nombre exact dans l'article) :

ScénarioSensCe qu'il sonde
Résumé académiqueEN → ZHJargon, voix passive, registre formel
Clause de contrat juridiqueEN → ZHLongues phrases imbriquées, précision, langage juridique
Doc technique avec codeEN → ZHLes identifiants entre backticks doivent rester non traduits
Prose littéraireZH → ENRegistre d'inspiration classique, rythme, imagerie
Dialogue de mangaJA → ENRegistre familier, voix des personnages, particules de fin de phrase
Tableau MarkdownEN → ZHStructure du tableau, codes d'erreur, unités
Cohérence terminologique sur document longEN → ZHUn terme polysémique traduit de façon cohérente d'un paragraphe à l'autre
Bruit d'OCREN → ZHLa source contient des artefacts de scan ; le modèle doit restituer l'intention, pas recopier les erreurs

Dans la mesure du possible, nous réutilisons les textes sources exacts des séries précédentes, inchangés, afin que les résultats puissent être comparés dans le temps et pas seulement face aux modèles d'un même test.

Chaque série teste les modèles phares du moment côte à côte dans la même arène — par exemple la dernière génération d'OpenAI, Anthropic, Google et DeepSeek, plus la génération précédente à titre de comparaison.

Comment nous notons

  • Chaque cellule est exécutée plusieurs fois ; nous prenons la médiane. Un appel API isolé est soumis à une variance côté serveur, et tirer des conclusions d'un seul échantillon revient à publier de la chance comme si c'était un résultat.
  • Notation en aveugle par deux juges, et les juges ne sont pas des concurrents. Les traductions candidates sont anonymisées en A / B / C… (remélangées indépendamment à chaque série) et notées de 1 à 5 sur la fidélité, la fluidité, la terminologie, le style et la mise en forme par deux juges LLM indépendants. Aucun juge ne figure dans la liste des concurrents — laisser un modèle noter sa propre production introduit un biais.
DimensionCe qu'elle mesure
FidélitéSens préservé ; rien d'omis ni d'inventé
FluiditéFormulation naturelle dans la langue cible
TerminologieTermes cohérents et conformes aux usages du secteur
StyleRegistre et ton fidèles à la source
Mise en formeDisposition, tableaux et structure préservés

Comment les notes sont agrégées. Les cinq dimensions ont un poids égal. Pour chaque traduction, nous faisons la moyenne des cinq dimensions par juge, puis la moyenne des deux juges ; la note d'un modèle sur un scénario est la médiane de ses runs répétés ; sa note globale est la moyenne de ses notes par scénario. Coût par point = le coût par appel du modèle ÷ sa note globale.

Comment nous garantissons l'équité

  • Le même prompt pour chaque modèle. Tous les candidats traduisent sous une seule et même consigne minimale, afin de mesurer le modèle — pas l'ingénierie de prompt.
  • Étiquettes en aveugle. Les juges voient les traductions, pas les noms des modèles ; les étiquettes sont remélangées indépendamment pour chaque juge.
  • Texte source affiché. Chaque test publie le texte original à côté des traductions candidates, pour que vous puissiez vérifier notre notation face à la production réelle plutôt que de nous croire sur parole.

Au‑delà de la qualité

La qualité de traduction ne résume pas toute la décision : chaque série enregistre donc aussi la latence (temps pour traduire un échantillon standard), le coût (avec des comparaisons du coût par point) et la préservation de la mise en forme — à savoir si les tableaux, les colonnes et la structure survivent dans la sortie, sondés par les scénarios du tableau Markdown et du bruit d'OCR. À noter : il s'agit de tests sur des fragments de texte, pas sur des documents entiers ; le comportement sur de grands PDF multipages ou scannés peut différer (voir Limites).

Données et archivage

Chaque article montre — pour chaque scénario — le texte source, la traduction de chaque modèle et les notes par dimension, de sorte que tout résultat peut être vérifié face à la production réelle directement sur la page. Derrière cela, l'ensemble complet des traductions brutes, des notes des juges et des scripts d'agrégation est archivé, et les chiffres de chaque article sont rapportés directement depuis cette archive.

À quelle fréquence nous mettons à jour

Nous relançons les tests dès qu'un modèle publie une nouvelle version ou qu'une mise à jour majeure survient, et nous révisons les articles concernés plutôt que de laisser des chiffres périmés en ligne. Chaque article indique sa date de dernière mise à jour afin que vous sachiez à quel point les résultats sont récents.

Indépendance éditoriale

  • Transparence : BelinDoc est notre propre produit. Il figure dans ces comparatifs parce qu'il fonctionne avec les mêmes modèles que ceux que nous testons.
  • Nous publions aussi là où nous perdons. Lorsqu'un modèle concurrent, ou un outil tiers, fait mieux sur un scénario que l'option que nous recommanderions, nous le disons — un test n'est utile que s'il est honnête sur les compromis.
  • Nous ne sélectionnons pas des échantillons pour flatter un résultat, et nous n'ajustons pas les notes après coup.

Limites

  • Les juges sont des LLM, pas des traducteurs humains. Les juges LLM sont raisonnablement fiables sur les dimensions vérifiables comme la fidélité et la terminologie ; traitez le « style » avec plus de prudence.
  • La production d'un modèle varie d'un run à l'autre ; prendre la médiane sur plusieurs runs réduit ce phénomène, mais les notes restent un repère réfléchi, pas une garantie pour chaque document.
  • Chaque série couvre un ensemble fini de scénarios et un sens de traduction déclaré — de bons résultats dans un domaine ne garantissent pas les mêmes ailleurs.

Des questions sur nos tests ? Nous contacter.