Каждый обзор модели и бенчмарк в этом блоге следует описанному ниже процессу. Мы публикуем его, чтобы вы могли сами оценить наши выводы — и сверить их с исходными текстами, которые мы показываем.
Что мы оцениваем
Мы тестируем доступные в BelinDoc модели ИИ‑перевода на тех задачах, с которыми люди реально приходят к переводчику документов, а не на абстрактных рейтингах. Стандартный бенчмарк модели охватывает до восьми сценариев документов, каждый из которых проверяет одну конкретную слабость (более ранние или узконаправленные обзоры используют меньше и указывают точное число в статье):
| Сценарий | Направление | Что проверяет |
|---|---|---|
| Научная аннотация | EN → ZH | Терминология, пассивный залог, формальный регистр |
| Пункт юридического договора | EN → ZH | Вложенные длинные предложения, точность, юридический язык |
| Техническая документация с кодом | EN → ZH | Идентификаторы в обратных кавычках должны оставаться непереведёнными |
| Художественная проза | ZH → EN | Классический регистр, ритм, образность |
| Диалог из манги | JA → EN | Разговорный регистр, характер персонажа, финальные частицы |
| Таблица в Markdown | EN → ZH | Структура таблицы, коды ошибок, единицы измерения |
| Единство терминов в длинном документе | EN → ZH | Один многозначный термин, переведённый единообразно по всем абзацам |
| Шум OCR | EN → ZH | В источнике есть артефакты сканирования; модель должна восстановить смысл, а не копировать ошибки |
Где это возможно, мы повторно используем те же исходные тексты из прошлых раундов без изменений, чтобы результаты можно было сравнивать во времени, а не только с моделями в рамках одного обзора.
В каждом раунде актуальные флагманские модели тестируются бок о бок на одной арене — например, новейшее поколение от OpenAI, Anthropic, Google и DeepSeek, плюс предыдущее поколение для сравнения.
Как мы выставляем оценки
- Каждая ячейка прогоняется несколько раз; мы берём медиану. Один вызов API подвержен разбросу на стороне сервера, и делать выводы по одной выборке — верный способ выдать удачу за закономерность.
- Двойное слепое судейство, и судьи не участвуют в состязании. Переводы‑кандидаты анонимизируются как A / B / C… (перетасовываются независимо в каждом раунде) и оцениваются по шкале 1–5 по точности, плавности, терминологии, стилю и форматированию двумя независимыми ИИ‑судьями. Ни один судья не входит в список участников — позволять модели оценивать собственный вывод значит вносить смещение.
| Критерий | Что измеряет |
|---|---|
| Точность | Смысл сохранён; ничего не потеряно и не придумано |
| Плавность | Естественные формулировки на языке перевода |
| Терминология | Единообразные, общепринятые в отрасли термины |
| Стиль | Регистр и тон соответствуют оригиналу |
| Форматирование | Вёрстка, таблицы и структура сохранены |
Как агрегируются оценки. Пять критериев имеют одинаковый вес. Для каждого перевода мы усредняем пять критериев по каждому судье, а затем усредняем двух судей; оценка модели в сценарии — это медиана её повторных прогонов; итоговая оценка — среднее её оценок по сценариям. Стоимость за балл = стоимость одного вызова модели ÷ её итоговая оценка.
Как мы обеспечиваем честность
- Один и тот же промпт для каждой модели. Все кандидаты переводят по одной идентичной минимальной инструкции, поэтому мы измеряем модель, а не инженерию промптов.
- Слепые метки. Судьи видят переводы, а не названия моделей; метки перетасовываются независимо для каждого судьи.
- Показан исходный текст. В каждом обзоре оригинал публикуется рядом с переводами‑кандидатами, чтобы вы могли сверить наши оценки с реальным выводом, а не принимать их на веру.
Помимо качества
Качество перевода — не единственный фактор решения, поэтому в каждом раунде мы также фиксируем задержку (время перевода стандартной выборки), стоимость (включая сравнения стоимости за балл) и сохранение форматирования — сохраняются ли таблицы, столбцы и структура в выводе, что проверяется сценариями с таблицей в Markdown и шумом OCR. Обратите внимание: это тесты на фрагментах текста, а не на полных документах; поведение на больших многостраничных или отсканированных PDF может отличаться (см. «Ограничения»).
Данные и ведение записей
В каждой статье показаны — по каждому сценарию — исходный текст, перевод каждой модели и оценки по каждому критерию, так что любой результат можно сверить с реальным выводом прямо на странице. За этим стоит архив: полный набор сырых переводов, оценки судей и скрипты агрегации архивируются, а числа в каждой статье приводятся прямо из этого архива.
Как часто мы обновляем
Мы перезапускаем обзоры, когда выходит новая версия модели или крупное обновление, и пересматриваем затронутые статьи, а не оставляем устаревшие числа. В каждой статье указана её дата последнего обновления, чтобы вы знали, насколько актуальны результаты.
Редакционная независимость
- Раскрытие: BelinDoc — наш собственный продукт. Он появляется в этих сравнениях потому, что работает на тех же моделях, что мы тестируем.
- Мы публикуем и там, где проигрываем. Когда конкурирующая модель или сторонний инструмент справляется в каком‑то сценарии лучше, чем вариант, который мы бы рекомендовали, мы говорим об этом — обзоры полезны лишь тогда, когда честны в отношении компромиссов.
- Мы не подбираем выгодные выборки, чтобы приукрасить результат, и не корректируем оценки задним числом.
Ограничения
- Судьи — это ИИ, а не переводчики‑люди. ИИ‑судьи достаточно надёжны на проверяемых критериях, таких как точность и терминология; к «стилю» относитесь с большей осторожностью.
- Вывод модели меняется от прогона к прогону; взятие медианы по повторам снижает этот разброс, но оценки остаются взвешенным ориентиром, а не гарантией для каждого документа.
- Каждый раунд охватывает конечный набор сценариев и заявленное направление перевода — сильные результаты в одной области не гарантируют того же в другой.
Есть вопросы о нашем тестировании? Связаться с нами.