Chaque test et benchmark de modèle sur ce blog suit le processus décrit ci‑dessous. Nous le publions pour que vous puissiez juger nos conclusions par vous‑même — et les vérifier face aux textes sources que nous montrons.
Ce que nous évaluons
Nous testons les modèles de traduction IA disponibles sur BelinDoc sur les documents que les gens confient réellement à un traducteur de documents, et non sur des classements abstraits. Un benchmark de modèle standard couvre jusqu'à huit scénarios de documents, chacun sondant une faiblesse précise (les tests plus anciens ou ciblés en utilisent moins et précisent le nombre exact dans l'article) :
| Scénario | Sens | Ce qu'il sonde |
|---|---|---|
| Résumé académique | EN → ZH | Jargon, voix passive, registre formel |
| Clause de contrat juridique | EN → ZH | Longues phrases imbriquées, précision, langage juridique |
| Doc technique avec code | EN → ZH | Les identifiants entre backticks doivent rester non traduits |
| Prose littéraire | ZH → EN | Registre d'inspiration classique, rythme, imagerie |
| Dialogue de manga | JA → EN | Registre familier, voix des personnages, particules de fin de phrase |
| Tableau Markdown | EN → ZH | Structure du tableau, codes d'erreur, unités |
| Cohérence terminologique sur document long | EN → ZH | Un terme polysémique traduit de façon cohérente d'un paragraphe à l'autre |
| Bruit d'OCR | EN → ZH | La source contient des artefacts de scan ; le modèle doit restituer l'intention, pas recopier les erreurs |
Dans la mesure du possible, nous réutilisons les textes sources exacts des séries précédentes, inchangés, afin que les résultats puissent être comparés dans le temps et pas seulement face aux modèles d'un même test.
Chaque série teste les modèles phares du moment côte à côte dans la même arène — par exemple la dernière génération d'OpenAI, Anthropic, Google et DeepSeek, plus la génération précédente à titre de comparaison.
Comment nous notons
- Chaque cellule est exécutée plusieurs fois ; nous prenons la médiane. Un appel API isolé est soumis à une variance côté serveur, et tirer des conclusions d'un seul échantillon revient à publier de la chance comme si c'était un résultat.
- Notation en aveugle par deux juges, et les juges ne sont pas des concurrents. Les traductions candidates sont anonymisées en A / B / C… (remélangées indépendamment à chaque série) et notées de 1 à 5 sur la fidélité, la fluidité, la terminologie, le style et la mise en forme par deux juges LLM indépendants. Aucun juge ne figure dans la liste des concurrents — laisser un modèle noter sa propre production introduit un biais.
| Dimension | Ce qu'elle mesure |
|---|---|
| Fidélité | Sens préservé ; rien d'omis ni d'inventé |
| Fluidité | Formulation naturelle dans la langue cible |
| Terminologie | Termes cohérents et conformes aux usages du secteur |
| Style | Registre et ton fidèles à la source |
| Mise en forme | Disposition, tableaux et structure préservés |
Comment les notes sont agrégées. Les cinq dimensions ont un poids égal. Pour chaque traduction, nous faisons la moyenne des cinq dimensions par juge, puis la moyenne des deux juges ; la note d'un modèle sur un scénario est la médiane de ses runs répétés ; sa note globale est la moyenne de ses notes par scénario. Coût par point = le coût par appel du modèle ÷ sa note globale.
Comment nous garantissons l'équité
- Le même prompt pour chaque modèle. Tous les candidats traduisent sous une seule et même consigne minimale, afin de mesurer le modèle — pas l'ingénierie de prompt.
- Étiquettes en aveugle. Les juges voient les traductions, pas les noms des modèles ; les étiquettes sont remélangées indépendamment pour chaque juge.
- Texte source affiché. Chaque test publie le texte original à côté des traductions candidates, pour que vous puissiez vérifier notre notation face à la production réelle plutôt que de nous croire sur parole.
Au‑delà de la qualité
La qualité de traduction ne résume pas toute la décision : chaque série enregistre donc aussi la latence (temps pour traduire un échantillon standard), le coût (avec des comparaisons du coût par point) et la préservation de la mise en forme — à savoir si les tableaux, les colonnes et la structure survivent dans la sortie, sondés par les scénarios du tableau Markdown et du bruit d'OCR. À noter : il s'agit de tests sur des fragments de texte, pas sur des documents entiers ; le comportement sur de grands PDF multipages ou scannés peut différer (voir Limites).
Données et archivage
Chaque article montre — pour chaque scénario — le texte source, la traduction de chaque modèle et les notes par dimension, de sorte que tout résultat peut être vérifié face à la production réelle directement sur la page. Derrière cela, l'ensemble complet des traductions brutes, des notes des juges et des scripts d'agrégation est archivé, et les chiffres de chaque article sont rapportés directement depuis cette archive.
À quelle fréquence nous mettons à jour
Nous relançons les tests dès qu'un modèle publie une nouvelle version ou qu'une mise à jour majeure survient, et nous révisons les articles concernés plutôt que de laisser des chiffres périmés en ligne. Chaque article indique sa date de dernière mise à jour afin que vous sachiez à quel point les résultats sont récents.
Indépendance éditoriale
- Transparence : BelinDoc est notre propre produit. Il figure dans ces comparatifs parce qu'il fonctionne avec les mêmes modèles que ceux que nous testons.
- Nous publions aussi là où nous perdons. Lorsqu'un modèle concurrent, ou un outil tiers, fait mieux sur un scénario que l'option que nous recommanderions, nous le disons — un test n'est utile que s'il est honnête sur les compromis.
- Nous ne sélectionnons pas des échantillons pour flatter un résultat, et nous n'ajustons pas les notes après coup.
Limites
- Les juges sont des LLM, pas des traducteurs humains. Les juges LLM sont raisonnablement fiables sur les dimensions vérifiables comme la fidélité et la terminologie ; traitez le « style » avec plus de prudence.
- La production d'un modèle varie d'un run à l'autre ; prendre la médiane sur plusieurs runs réduit ce phénomène, mais les notes restent un repère réfléchi, pas une garantie pour chaque document.
- Chaque série couvre un ensemble fini de scénarios et un sens de traduction déclaré — de bons résultats dans un domaine ne garantissent pas les mêmes ailleurs.
Des questions sur nos tests ? Nous contacter.