本博客上每一篇模型评测与基准测试都遵循下面这套流程。我们把它公开出来,是为了让你能自己判断我们的结论是否成立——并对照我们展示的源文去核验。
我们测什么
我们测的是 BelinDoc 上可用的各款 AI 翻译模型,考察的是大家真正会拿到文档翻译器里的活儿,而不是抽象的排行榜。标准的模型基准通常覆盖至多 8 个文档场景,每个场景专门戳一个具体的短板(较早或专题评测会用更少的场景,并在文中注明实际的场景数):
| 场景 | 方向 | 考察点 |
|---|---|---|
| 学术论文摘要 | 英 → 中 | 术语、被动语态、正式语域 |
| 法律合同条款 | 英 → 中 | 层层嵌套的长句、精确性、法律行话 |
| 含代码的技术文档 | 英 → 中 | 反引号内的标识符必须保持不译 |
| 文学散文 | 中 → 英 | 带古典味的语域、节奏、意象 |
| 漫画对白 | 日 → 英 | 口语语域、角色声口、句末语气词 |
| Markdown 表格 | 英 → 中 | 表格结构、错误码、单位 |
| 长文档术语一致性 | 英 → 中 | 一个多义词在多个段落间保持统一译法 |
| OCR 噪声 | 英 → 中 | 源文含扫描杂讯,模型应还原本意,而非照抄错误 |
只要条件允许,我们就原样复用早前几轮用过的同一批源文,不作改动,这样结果就能跨时间对比,而不只是和单次评测里的那几款模型比。
每一轮都把当代旗舰模型放在同一个擂台上同场竞技——比如 OpenAI、Anthropic、Google、DeepSeek 各自的最新一代,再加上上一代作对照。
我们怎么打分
- 每一格都多次重跑,取中位数。 单次 API 调用会受服务端波动影响,只凭一次采样下结论,等于把运气当成发现发表出去。
- 双评委盲评,且评委不参赛。 候选译文会被匿名成 A / B / C……(每轮独立重新洗牌),由两名相互独立的 LLM 评委按忠实度、流畅度、术语、风格、格式这 5 个维度打 1–5 分。两名评委都不在参赛模型名单里——让一个模型给自己的输出打分会引入偏差。
| 维度 | 衡量的是 |
|---|---|
| 忠实度 | 语义是否保留,有无漏译或臆造 |
| 流畅度 | 目标语言表达是否自然 |
| 术语 | 用语是否统一、是否符合行业标准 |
| 风格 | 语域和语气是否贴合源文 |
| 格式 | 版式、表格、结构是否保留 |
分数如何聚合。 五个维度等权。对每一份译文,先在五个维度上取平均,得到该评委给出的单个分数,再对两名评委取平均;某款模型在某个场景的得分,是它多次重复的中位数;模型的总分是它各场景得分的平均。每分成本 = 该模型单次调用成本 ÷ 总分。
我们如何保证公平
- 所有模型用同一条提示词。 全部候选都在同一条最简指令下翻译,这样我们量的是模型本身——而不是提示词工程。
- 盲标签。 评委看到的是译文,而非模型名;标签对每名评委都独立洗牌。
- 展示源文。 每篇评测都会把原文和候选译文并列展示出来,这样你能拿我们的评分去对照实际输出,而不必凭空相信。
质量之外
翻译质量并不是决策的全部,因此每一轮我们还会记录延迟(翻译一段标准样例所需的时间)、成本(含每分成本的对比),以及格式保留——表格、分栏、结构在译文中是否存活,由 Markdown 表格与 OCR 噪声这两个场景来考察。请注意:这些都是文本片段测试,并非完整文档;在大型多页或扫描 PDF 上的表现可能有所不同(见局限)。
数据与存档
每篇文章都会按场景展示源文、各款模型的译文,以及各维度的分数,所以任何结论都能拿页面上的实际输出来核对。在此之上,全部原始译文、评委打分以及聚合脚本都已归档,文中的数字直接出自该归档。
我们多久更新一次
当某款模型发布新版本或有重大更新落地时,我们会重跑评测,并修订受影响的文章,而不是把过时的数字挂在那里。每篇文章都会标出它的最后更新日期,让你知道结果有多新。
编辑独立性
- 利益披露: BelinDoc 是我们自家的产品。它出现在这些对比里,是因为它跑的正是我们测的这些模型。
- 输了也照实写。 当某款竞品模型、或某个第三方工具,在某个场景上比我们会推荐的选项表现更好时,我们会照实写出来——评测只有对权衡取舍诚实才有价值。
- 我们不会挑拣样本来粉饰结果,也不会事后调分。
局限
- 评委是 LLM,不是人类译者。 LLM 评委在忠实度、术语这类可核验的维度上还算可靠;对"风格"则要多留一分谨慎。
- 模型输出每次重跑都会有波动,多次取中位数能削弱这一点,但分数仍只是一个经过斟酌的参考点,而非对每一份文档的保证。
- 每一轮只覆盖有限的场景和明确标注的语言方向——在某个领域表现出色,并不保证换个领域也一样。
对我们的测评方式有疑问?联系我们。