本部落格上每一篇模型評測與橫評,都遵循以下流程。我們把流程公開,讓你能自行檢驗我們的結論——並對照我們一併呈現的原始文本加以核實。
我們評測什麼
我們針對 BelinDoc 上實際可用的 AI 翻譯模型進行測試,考驗的是大家真正會拿到文件翻譯工具上處理的內容,而非抽象的排行榜。標準的模型基準測試通常涵蓋至多八種文件情境,每一種都針對某項特定弱點(較早或專題性的評測會使用更少情境,並在文中註明實際的情境數):
| 情境 | 語向 | 考驗重點 |
|---|---|---|
| 學術摘要 | 英 → 中 | 專業術語、被動語態、正式語域 |
| 法律合約條款 | 英 → 中 | 巢狀長句、精準度、法律用語 |
| 含程式碼的技術文件 | 英 → 中 | 反引號內的識別符必須維持不譯 |
| 文學散文 | 中 → 英 | 帶古典韻味的語域、節奏、意象 |
| 漫畫對白 | 日 → 英 | 口語語域、角色聲口、句尾語氣詞 |
| Markdown 表格 | 英 → 中 | 表格結構、錯誤碼、單位 |
| 長文件術語一致性 | 英 → 中 | 一個多義詞在各段落間須譯得一致 |
| OCR 雜訊 | 英 → 中 | 原文夾帶掃描瑕疵;模型應還原本意,而非照抄錯誤 |
在可行的情況下,我們會沿用先前各輪的完全相同原始文本,一字不改,讓結果能跨時間比較,而不只是在單一評測裡與同場模型互比。
每一輪都讓當前的旗艦模型同場捉對較量——例如 OpenAI、Anthropic、Google 與 DeepSeek 的最新世代,再加上前一世代作為對照。
我們如何評分
- **每一格都跑多次,取中位數。**單次 API 呼叫會受伺服器端變異影響,只憑一次取樣就下結論,等於把運氣當成發現公諸於世。
- 雙評委盲評,且評委不是參賽者。候選譯文會被匿名化為 A / B / C……(每一輪各自重新洗牌),並由兩位獨立的 LLM 評委就忠實度、流暢度、術語、風格、格式五個維度打 1–5 分。任一評委都不會出現在參賽名單中——讓模型替自己的輸出打分會引入偏差。
| 維度 | 衡量什麼 |
|---|---|
| 忠實度 | 意義完整保留;沒有漏譯或臆造 |
| 流暢度 | 目標語言的自然措辭 |
| 術語 | 用詞一致、符合業界標準 |
| 風格 | 語域與語氣貼合原文 |
| 格式 | 版面、表格與結構完整保留 |
分數如何彙總。五個維度等權。每一份譯文先對五個維度取平均,得出單一評委的分數,再對兩位評委取平均;某個模型在某個情境的得分,是其多次重複的中位數;模型的總分,則是各情境得分的平均。每分成本 = 該模型單次呼叫的成本 ÷ 其總分。
我們如何確保公平
- **每個模型用同一套提示詞。**所有候選模型都在同一份精簡且相同的指令下翻譯,如此我們衡量的是模型本身——而非提示詞工程。
- **盲標籤。**評委看到的是譯文,而非模型名稱;標籤會為每位評委各自獨立洗牌。
- **一併呈現原始文本。**每篇評測都會把原文與各候選譯文並列刊出,讓你能拿我們的評分對照實際輸出來核對,而不必全憑信任。
品質之外
翻譯品質並非決策的全部,因此每一輪也會記錄延遲(翻譯一份標準樣本所需的時間)、成本(含每分成本的比較),以及格式保留:表格、分欄與結構在譯文中是否存活,由 Markdown 表格與 OCR 雜訊這兩個情境來考察。請注意:這些都是文字片段測試,並非完整文件;在大型多頁或掃描 PDF 上的表現可能有所不同(見局限)。
資料與紀錄留存
每篇文章都會按情境呈現源文、各模型的譯文,以及各維度的分數,讓任何結論都能用頁面上的實際輸出來核對。在此之上,全部原始譯文、評委打分與彙整腳本均已歸檔,文中的數字直接出自該歸檔。
我們多久更新一次
當某個模型推出新版本或有重大更新時,我們會重跑評測,並改寫受影響的文章,而不是放著過時的數字不管。每篇文章都會標示其最後更新日期,讓你知道結果有多新。
編輯獨立性
- **利益揭露:**BelinDoc 是我們自家的產品。它之所以出現在這些比較中,是因為它跑的正是我們所測試的那些模型。
- **輸了我們照樣寫出來。**當某個競品模型、或某個第三方工具,在某個情境上比我們會推薦的選項表現更好時,我們就照實寫出——唯有誠實面對取捨,評測才有價值。
- 我們不會為了讓結果好看而精挑樣本,也不會事後調整分數。
局限
- **評委是 LLM,不是人類譯者。**LLM 評委在忠實度、術語這類可查核的維度上相當可靠;「風格」一項則請以更審慎的態度看待。
- 模型輸出會因每次執行而異;跨多次重複取中位數能降低這種波動,但分數仍是一個經過斟酌的參考點,並非對每一份文件的保證。
- 每一輪只涵蓋有限的情境集與明確標示的語向——在某個領域表現亮眼,並不保證在其他領域也一樣。
對我們的評測方式有疑問?聯絡我們。