Belin Doc IconBelin Doc

PDF 怎么翻译:五步完整流程

文字版、扫描件、三百页的大文件,都走同一套五步流程。第一步决定最终效果,而多数人恰恰跳过了它。

更新于

#PDF 怎么翻译
#PDF 翻译步骤
#扫描件翻译
#文档翻译

快速答案

PDF 翻译分五步:先判断文件是哪一类,再设定语言对、选模型、开始翻译,最后只检查四个位置。第一步决定后面所有环节——文字版 PDF 和扫描件要走完全不同的路,把扫描件当文字版处理,正是译文出问题的起点。

第一步:先判断文件是哪一类

文件类型怎么判断意味着什么
文字版 PDF能用光标选中正文的句子文字可直接提取,风险只在结构
扫描件 PDF选不中,整页就是一张图必须先做 OCR 才谈得上翻译
带 OCR 层的扫描件能选中,但高亮和字有偏移文件里已有一层隐藏文字,正是译后出现双层文字的原因

动手之前,先试着选中一行正文。这三十秒能避掉下面大部分麻烦。

第二步:设定语言对,选好模型

  • 源语言手动指定,别依赖自动识别——中英混排的文档,自动识别错的时候比对的时候多
  • 按文档类型选模型,而不是按跑分:见该用哪个 AI 模型
  • 如果是扫描件,开始前先确认流程里包含 OCR:见扫描件怎么翻译

第三步:先锁死不该被改的内容

  • 产品名、料号、法律术语,要在第一次翻译前就进术语库,而不是事后逐处改
  • 公式、单位、表格里的数字应当原样带过:见怎么保住公式
  • 文件太大或上传卡住,先拆分再传,别反复重试:见大文件 PDF 怎么翻译

第四步:开始翻译

上传文件,确认语言对和模型,然后开始。免费额度按页数计,不按文件体积——见免费额度包含什么。可以直接从 PDF 翻译工具开始。

第五步:只检查四个位置

不用通读全文,看这四处就够:

  • 表格之后的第一页——阅读顺序最先在这里乱
  • 任何分栏页面——两栏的句子被串成一句,是最常见的错法
  • 一张带数字的表格——查数字,不查措辞
  • 最后一页——截断总是出现在结尾

出问题时对照这张表

你看到的现象实际发生了什么去哪儿解决
乱码、段落顺序错乱解析阶段结构就丢了PDF 翻译为什么会坏
文字互相叠在一起文件里残留了隐藏的 OCR 层译后出现双层文字
整份文件没被翻译页面是图片,OCR 没跑起来扫描件怎么翻译
上传失败或卡住一次处理不下这么大的文件大文件 PDF 怎么翻译
译文还需要继续编辑PDF 本来就不是用来编辑的格式PDF 转 Word

相关工具

结论

PDF 翻译的成败,多半在点击「翻译」之前就定了:文件是文字版还是扫描件,结构能不能被完整解析出来。这两件事做对,再按四个位置抽查译文,整套方法就这些。