Belin Doc IconBelin Doc

Почему после перевода PDF получается два слоя текста

Наложенный или невидимый текст после перевода пдф — признак скрытого OCR-слоя внутри скана. Как его распознать и как свести файл в один слой перед переводом.

Обновлено

#два слоя текста
#отсканированный PDF
#скрытый OCR-слой
#перевод пдф

Кратко

Двойные текстовые слои после перевода PDF возникают в основном потому, что исходный документ имеет невидимый текстовый слой, сформированный после сканирования.

Откуда в скане берется скрытый текстовый слой

Некоторые файлы PDF после сканирования формируют невидимый текстовый слой на поверхности. Когда такие отсканированные PDF отправляются на перевод, это вызывает двойные текстовые слои или видим только исходный текст (переведенный текст прозрачен и находится сверху).

Как понять, что в PDF есть скрытый слой

  • Переведенные документы показывают наложение исходного и переведенного текста
  • Виден только исходный текст, в то время как перевод существует, но невидим
  • Наложение текстовых слоев вызывает трудности при чтении

Как убрать наложение текста после перевода

  • Загрузить неотсканированные исходные PDF-документы
  • Воспользуйтесь инструментом Flatten PDF, чтобы свести отсканированный документ в один слой перед переводом
  • Убедиться, что загружаемые файлы PDF не содержат скрытых текстовых слоев

Связанные инструменты

Итог

Проблема двойных текстовых слоев проистекает из специальной структуры отсканированных PDF. Использование исходных PDF или преобразование в документы с одним слоем может избежать этой проблемы.