Belin Doc IconBelin Doc

我们如何测评 AI 翻译

BelinDoc Team2026/07/22

BelinDoc 博客上每一篇模型评测与基准测试背后的方法论:我们测哪些文档场景、如何用双 LLM 评委盲评打分、如何多次重跑取值,以及如何让结果保持客观且与时俱进。

本博客上每一篇模型评测与基准测试都遵循下面这套流程。我们把它公开出来,是为了让你能自己判断我们的结论是否成立——并对照我们展示的源文去核验。

我们测什么

我们测的是 BelinDoc 上可用的各款 AI 翻译模型,考察的是大家真正会拿到文档翻译器里的活儿,而不是抽象的排行榜。标准的模型基准通常覆盖至多 8 个文档场景,每个场景专门戳一个具体的短板(较早或专题评测会用更少的场景,并在文中注明实际的场景数):

场景方向考察点
学术论文摘要英 → 中术语、被动语态、正式语域
法律合同条款英 → 中层层嵌套的长句、精确性、法律行话
含代码的技术文档英 → 中反引号内的标识符必须保持不译
文学散文中 → 英带古典味的语域、节奏、意象
漫画对白日 → 英口语语域、角色声口、句末语气词
Markdown 表格英 → 中表格结构、错误码、单位
长文档术语一致性英 → 中一个多义词在多个段落间保持统一译法
OCR 噪声英 → 中源文含扫描杂讯,模型应还原本意,而非照抄错误

只要条件允许,我们就原样复用早前几轮用过的同一批源文,不作改动,这样结果就能跨时间对比,而不只是和单次评测里的那几款模型比。

每一轮都把当代旗舰模型放在同一个擂台上同场竞技——比如 OpenAI、Anthropic、Google、DeepSeek 各自的最新一代,再加上上一代作对照。

我们怎么打分

  • 每一格都多次重跑,取中位数。 单次 API 调用会受服务端波动影响,只凭一次采样下结论,等于把运气当成发现发表出去。
  • 双评委盲评,且评委不参赛。 候选译文会被匿名成 A / B / C……(每轮独立重新洗牌),由两名相互独立的 LLM 评委按忠实度、流畅度、术语、风格、格式这 5 个维度打 1–5 分。两名评委都不在参赛模型名单里——让一个模型给自己的输出打分会引入偏差。
维度衡量的是
忠实度语义是否保留,有无漏译或臆造
流畅度目标语言表达是否自然
术语用语是否统一、是否符合行业标准
风格语域和语气是否贴合源文
格式版式、表格、结构是否保留

分数如何聚合。 五个维度等权。对每一份译文,先在五个维度上取平均,得到该评委给出的单个分数,再对两名评委取平均;某款模型在某个场景的得分,是它多次重复的中位数;模型的总分是它各场景得分的平均。每分成本 = 该模型单次调用成本 ÷ 总分。

我们如何保证公平

  • 所有模型用同一条提示词。 全部候选都在同一条最简指令下翻译,这样我们量的是模型本身——而不是提示词工程。
  • 盲标签。 评委看到的是译文,而非模型名;标签对每名评委都独立洗牌。
  • 展示源文。 每篇评测都会把原文和候选译文并列展示出来,这样你能拿我们的评分去对照实际输出,而不必凭空相信。

质量之外

翻译质量并不是决策的全部,因此每一轮我们还会记录延迟(翻译一段标准样例所需的时间)、成本(含每分成本的对比),以及格式保留——表格、分栏、结构在译文中是否存活,由 Markdown 表格与 OCR 噪声这两个场景来考察。请注意:这些都是文本片段测试,并非完整文档;在大型多页或扫描 PDF 上的表现可能有所不同(见局限)。

数据与存档

每篇文章都会按场景展示源文、各款模型的译文,以及各维度的分数,所以任何结论都能拿页面上的实际输出来核对。在此之上,全部原始译文、评委打分以及聚合脚本都已归档,文中的数字直接出自该归档。

我们多久更新一次

当某款模型发布新版本或有重大更新落地时,我们会重跑评测,并修订受影响的文章,而不是把过时的数字挂在那里。每篇文章都会标出它的最后更新日期,让你知道结果有多新。

编辑独立性

  • 利益披露: BelinDoc 是我们自家的产品。它出现在这些对比里,是因为它跑的正是我们测的这些模型。
  • 输了也照实写。 当某款竞品模型、或某个第三方工具,在某个场景上比我们会推荐的选项表现更好时,我们会照实写出来——评测只有对权衡取舍诚实才有价值。
  • 我们不会挑拣样本来粉饰结果,也不会事后调分。

局限

  • 评委是 LLM,不是人类译者。 LLM 评委在忠实度、术语这类可核验的维度上还算可靠;对"风格"则要多留一分谨慎。
  • 模型输出每次重跑都会有波动,多次取中位数能削弱这一点,但分数仍只是一个经过斟酌的参考点,而非对每一份文档的保证。
  • 每一轮只覆盖有限的场景和明确标注的语言方向——在某个领域表现出色,并不保证换个领域也一样。

对我们的测评方式有疑问?联系我们