Belin Doc IconBelin Doc

Как мы тестируем ИИ‑перевод

BelinDoc Team2026/07/22

Методология всех обзоров моделей и бенчмарков в блоге BelinDoc: тестовые сценарии документов, двойная слепая оценка ИИ‑судьями, повторные прогоны и то, как мы держим результаты честными и актуальными.

Каждый обзор модели и бенчмарк в этом блоге следует описанному ниже процессу. Мы публикуем его, чтобы вы могли сами оценить наши выводы — и сверить их с исходными текстами, которые мы показываем.

Что мы оцениваем

Мы тестируем доступные в BelinDoc модели ИИ‑перевода на тех задачах, с которыми люди реально приходят к переводчику документов, а не на абстрактных рейтингах. Стандартный бенчмарк модели охватывает до восьми сценариев документов, каждый из которых проверяет одну конкретную слабость (более ранние или узконаправленные обзоры используют меньше и указывают точное число в статье):

СценарийНаправлениеЧто проверяет
Научная аннотацияEN → ZHТерминология, пассивный залог, формальный регистр
Пункт юридического договораEN → ZHВложенные длинные предложения, точность, юридический язык
Техническая документация с кодомEN → ZHИдентификаторы в обратных кавычках должны оставаться непереведёнными
Художественная прозаZH → ENКлассический регистр, ритм, образность
Диалог из мангиJA → ENРазговорный регистр, характер персонажа, финальные частицы
Таблица в MarkdownEN → ZHСтруктура таблицы, коды ошибок, единицы измерения
Единство терминов в длинном документеEN → ZHОдин многозначный термин, переведённый единообразно по всем абзацам
Шум OCREN → ZHВ источнике есть артефакты сканирования; модель должна восстановить смысл, а не копировать ошибки

Где это возможно, мы повторно используем те же исходные тексты из прошлых раундов без изменений, чтобы результаты можно было сравнивать во времени, а не только с моделями в рамках одного обзора.

В каждом раунде актуальные флагманские модели тестируются бок о бок на одной арене — например, новейшее поколение от OpenAI, Anthropic, Google и DeepSeek, плюс предыдущее поколение для сравнения.

Как мы выставляем оценки

  • Каждая ячейка прогоняется несколько раз; мы берём медиану. Один вызов API подвержен разбросу на стороне сервера, и делать выводы по одной выборке — верный способ выдать удачу за закономерность.
  • Двойное слепое судейство, и судьи не участвуют в состязании. Переводы‑кандидаты анонимизируются как A / B / C… (перетасовываются независимо в каждом раунде) и оцениваются по шкале 1–5 по точности, плавности, терминологии, стилю и форматированию двумя независимыми ИИ‑судьями. Ни один судья не входит в список участников — позволять модели оценивать собственный вывод значит вносить смещение.
КритерийЧто измеряет
ТочностьСмысл сохранён; ничего не потеряно и не придумано
ПлавностьЕстественные формулировки на языке перевода
ТерминологияЕдинообразные, общепринятые в отрасли термины
СтильРегистр и тон соответствуют оригиналу
ФорматированиеВёрстка, таблицы и структура сохранены

Как агрегируются оценки. Пять критериев имеют одинаковый вес. Для каждого перевода мы усредняем пять критериев по каждому судье, а затем усредняем двух судей; оценка модели в сценарии — это медиана её повторных прогонов; итоговая оценка — среднее её оценок по сценариям. Стоимость за балл = стоимость одного вызова модели ÷ её итоговая оценка.

Как мы обеспечиваем честность

  • Один и тот же промпт для каждой модели. Все кандидаты переводят по одной идентичной минимальной инструкции, поэтому мы измеряем модель, а не инженерию промптов.
  • Слепые метки. Судьи видят переводы, а не названия моделей; метки перетасовываются независимо для каждого судьи.
  • Показан исходный текст. В каждом обзоре оригинал публикуется рядом с переводами‑кандидатами, чтобы вы могли сверить наши оценки с реальным выводом, а не принимать их на веру.

Помимо качества

Качество перевода — не единственный фактор решения, поэтому в каждом раунде мы также фиксируем задержку (время перевода стандартной выборки), стоимость (включая сравнения стоимости за балл) и сохранение форматирования — сохраняются ли таблицы, столбцы и структура в выводе, что проверяется сценариями с таблицей в Markdown и шумом OCR. Обратите внимание: это тесты на фрагментах текста, а не на полных документах; поведение на больших многостраничных или отсканированных PDF может отличаться (см. «Ограничения»).

Данные и ведение записей

В каждой статье показаны — по каждому сценарию — исходный текст, перевод каждой модели и оценки по каждому критерию, так что любой результат можно сверить с реальным выводом прямо на странице. За этим стоит архив: полный набор сырых переводов, оценки судей и скрипты агрегации архивируются, а числа в каждой статье приводятся прямо из этого архива.

Как часто мы обновляем

Мы перезапускаем обзоры, когда выходит новая версия модели или крупное обновление, и пересматриваем затронутые статьи, а не оставляем устаревшие числа. В каждой статье указана её дата последнего обновления, чтобы вы знали, насколько актуальны результаты.

Редакционная независимость

  • Раскрытие: BelinDoc — наш собственный продукт. Он появляется в этих сравнениях потому, что работает на тех же моделях, что мы тестируем.
  • Мы публикуем и там, где проигрываем. Когда конкурирующая модель или сторонний инструмент справляется в каком‑то сценарии лучше, чем вариант, который мы бы рекомендовали, мы говорим об этом — обзоры полезны лишь тогда, когда честны в отношении компромиссов.
  • Мы не подбираем выгодные выборки, чтобы приукрасить результат, и не корректируем оценки задним числом.

Ограничения

  • Судьи — это ИИ, а не переводчики‑люди. ИИ‑судьи достаточно надёжны на проверяемых критериях, таких как точность и терминология; к «стилю» относитесь с большей осторожностью.
  • Вывод модели меняется от прогона к прогону; взятие медианы по повторам снижает этот разброс, но оценки остаются взвешенным ориентиром, а не гарантией для каждого документа.
  • Каждый раунд охватывает конечный набор сценариев и заявленное направление перевода — сильные результаты в одной области не гарантируют того же в другой.

Есть вопросы о нашем тестировании? Связаться с нами.