Коротко
Перевод PDF — это пять шагов: определить тип файла, задать языковую пару, выбрать модель, перевести и проверить результат в четырёх местах. Всё решает первый шаг: текстовый PDF и скан обрабатываются по-разному, и попытка работать со сканом как с текстом — источник большинства плохих переводов.
Шаг 1 — Определите тип PDF
| Тип файла | Как проверить | Что это значит |
|---|---|---|
| Текстовый PDF | Предложение выделяется курсором | Текст извлекается, риск только в структуре |
| Сканированный PDF | Ничего не выделяется, страница — это картинка | Сначала нужен OCR, иначе переводить нечего |
| Скан со слоем OCR | Выделение работает, но подсветка смещена относительно букв | Скрытый текстовый слой уже есть — именно он даёт два слоя текста после перевода |
Прежде чем что-то делать, попробуйте выделить строку основного текста. Эти тридцать секунд снимают большую часть проблем из списка ниже.
Шаг 2 — Языковая пара и модель
- Указывайте язык оригинала вручную, а не полагайтесь на автоопределение: в документах со смешанными языками оно ошибается чаще, чем срабатывает
- Модель выбирайте по типу документа, а не по баллам в тестах: см. какую модель ИИ использовать
- Для скана до запуска убедитесь, что OCR входит в обработку: см. как перевести сканированный PDF
Шаг 3 — Зафиксируйте то, что менять нельзя
- Названия продуктов, артикулы и юридические термины вносятся в глоссарий до первого запуска, а не правятся потом
- Формулы, единицы измерения и числа в таблицах должны пройти без изменений: см. как сохранить формулы
- Если файл очень большой или зависает при загрузке, разделите его вместо повторных попыток: см. перевод большого PDF
Шаг 4 — Запустите перевод
Загрузите файл, подтвердите пару языков и модель, запустите. Бесплатный объём считается в страницах, а не в мегабайтах — см. что доступно бесплатно. Начать можно прямо в переводчике PDF.
Шаг 5 — Проверьте четыре места
Перечитывать весь документ не нужно. Достаточно этих четырёх точек:
- Первая страница после таблицы — порядок чтения ломается там раньше всего
- Любая страница в две колонки — самая частая ошибка, когда два столбца сливаются в одну фразу
- Одна таблица с числами — проверяйте числа, а не формулировки
- Последняя страница — обрыв текста проявляется в конце
Если результат неправильный
| Что вы видите | Что произошло на самом деле | Где решать |
|---|---|---|
| Кракозябры, перепутанный порядок абзацев | Структура потеряна при извлечении | Почему ломается перевод PDF |
| Текст наложен сам на себя | В файле остался скрытый слой OCR | Два слоя текста |
| Ничего не переведено | Страница — изображение, OCR не отработал | Перевод сканированного PDF |
| Загрузка не проходит или зависает | Файл слишком велик для одной обработки | Перевод большого PDF |
| Результат нужно редактировать | PDF — не формат для редактирования | PDF в Word |
Связанные инструменты
Итог
Качество перевода PDF определяется ещё до нажатия кнопки: текст перед вами или скан, и сохранится ли структура при извлечении. Разберитесь с этими двумя вещами и проверьте четыре места в результате — вся методика в этом.