本ブログのモデルレビューとベンチマークは、すべて以下のプロセスに従っています。読者ご自身で結論を検証できるよう、そして掲載している原文と照らし合わせて確認できるよう、その手順を公開しています。
評価する対象
私たちは、抽象的なリーダーボードではなく、実際に文書翻訳ツールへ持ち込まれる作業を対象に、BelinDocで利用できるAI翻訳モデルをテストします。標準的なモデルベンチマークでは最大8つの文書シナリオをカバーし、それぞれが特定の弱点を突くように設計されています(初期のレビューや対象を絞ったレビューではこれより少なく、その正確な数は記事内に明記します)。
| シナリオ | 翻訳方向 | 検証する弱点 |
|---|---|---|
| 学術論文アブストラクト | EN → ZH | 専門用語、受動態、フォーマルなレジスター |
| 法律契約条項 | EN → ZH | 入れ子構造の長文、精密さ、法律特有の言い回し |
| コードを含む技術文書 | EN → ZH | バッククォート内の識別子は翻訳せず保持すべき |
| 文学的散文 | ZH → EN | 文語調のレジスター、リズム、情景描写 |
| マンガの台詞 | JA → EN | 口語的なレジスター、キャラクターの声、文末助詞 |
| Markdownの表 | EN → ZH | 表構造、エラーコード、単位 |
| 長文における用語の一貫性 | EN → ZH | 多義語を段落をまたいで一貫して訳せるか |
| OCRノイズ | EN → ZH | 原文にスキャンのノイズを含む。誤りをそのまま写すのではなく意図を復元すべき |
可能な限り、過去のラウンドで用いた原文をそのまま再利用します。これにより、1回のレビュー内のモデル同士だけでなく、時系列でも結果を比較できます。
各ラウンドでは、その時点のフラッグシップモデルを同じ土俵で横並びにテストします。たとえば、OpenAI・Anthropic・Google・DeepSeekの最新世代に加え、比較のため前世代も含めます。
採点の方法
- 各セルは複数回実行し、その中央値を採用します。 1回のAPI呼び出しはサーバー側のばらつきを受けるため、単一サンプルから結論を導くのは、偶然を「発見」として公表するようなものです。
- 2体のブラインド審査を行い、審査役は出場者に含めません。 候補訳文はA / B / C…と匿名化し(ラウンドごとに独立してシャッフル)、2体の独立したLLM審査役が忠実性・流暢さ・用語・スタイル・書式の5軸で1〜5点を付けます。いずれの審査役も出場者リストには登場しません。モデルに自らの出力を採点させるとバイアスが生じるためです。
| 評価軸 | 測定する内容 |
|---|---|
| 忠実性 | 意味が保たれ、欠落や捏造がないか |
| 流暢さ | 目標言語として自然な言い回しか |
| 用語 | 一貫した業界標準の用語か |
| スタイル | レジスターとトーンが原文に合致しているか |
| 書式 | レイアウト・表・構造が保持されているか |
スコアの集計方法。 5つの評価軸は等しく重み付けします。各訳文について、審査役ごとに5軸を平均し、次に2体の審査役の平均を取ります。あるシナリオにおけるモデルのスコアは、その複数回実行の中央値です。総合スコアはシナリオごとのスコアの平均です。1点あたりコストは、モデルの1回あたり呼び出しコスト ÷ 総合スコアで求めます。
公正さを保つ方法
- すべてのモデルに同一のプロンプト。 全候補が一つの同じ最小限の指示のもとで翻訳するため、測っているのはモデルそのものであり、プロンプトエンジニアリングではありません。
- ブラインドラベル。 審査役が見るのは訳文であってモデル名ではなく、ラベルは審査役ごとに独立してシャッフルされます。
- 原文を提示。 各レビューでは候補訳文とともに原文を掲載します。私たちの採点を鵜呑みにするのではなく、実際の出力と照らして確認できます。
品質以外の観点
翻訳品質だけで判断が決まるわけではないため、各ラウンドではレイテンシ(標準サンプルの翻訳にかかる時間)、コスト(1点あたりコストの比較を含む)、そして書式保持も記録します。書式保持とは、表・段組み・構造が出力にそのまま残るかどうかで、Markdownの表シナリオとOCRノイズシナリオで検証します。ただし、これらはテキスト断片のテストであって文書全体ではありません。複数ページにわたる大きなPDFやスキャンPDFでは挙動が異なる場合があります(「限界」を参照)。
データと記録の保管
各記事では、シナリオごとに原文、各モデルの訳文、そして評価軸ごとのスコアを掲載しているため、どの結果もページ上の実際の出力と照らして確認できます。その背後では、生の訳文一式、すべての審査スコア、集計スクリプトがアーカイブされており、各記事の数値はそのアーカイブからそのまま報告しています。
更新の頻度
モデルの新バージョンや大型アップデートが登場した際にレビューを再実行し、古い数値を放置せず該当記事を改訂します。各記事には最終更新日が表示されるため、結果がどれだけ最新かがわかります。
編集上の独立性
- 開示: BelinDocは私たち自身の製品です。私たちがテストするのと同じモデル上で動作しているため、これらの比較に登場します。
- 負けたところも公開します。 競合のモデル、あるいはサードパーティのツールが、あるシナリオで私たちが推奨する選択肢を上回った場合は、その旨を明記します。レビューはトレードオフに正直であってこそ役に立ちます。
- 結果をよく見せるためにサンプルを恣意的に選んだり、事後にスコアを調整したりすることはありません。
限界
- 審査役は人間の翻訳者ではなくLLMです。 LLM審査役は忠実性や用語のような検証可能な軸ではそれなりに信頼できますが、「スタイル」についてはより慎重に扱ってください。
- モデルの出力は実行ごとに変動します。複数回の中央値を取ることでこれは軽減されますが、スコアはあくまで熟慮された参考値であり、あらゆる文書での保証ではありません。
- 各ラウンドは有限のシナリオと明示された翻訳方向をカバーします。ある領域で高い結果が出ても、別の領域で同じとは限りません。
テスト方法についてのご質問は お問い合わせ までどうぞ。