快速答案
PDF 翻译分五步:先判断文件是哪一类,再设定语言对、选模型、开始翻译,最后只检查四个位置。第一步决定后面所有环节——文字版 PDF 和扫描件要走完全不同的路,把扫描件当文字版处理,正是译文出问题的起点。
第一步:先判断文件是哪一类
| 文件类型 | 怎么判断 | 意味着什么 |
|---|---|---|
| 文字版 PDF | 能用光标选中正文的句子 | 文字可直接提取,风险只在结构 |
| 扫描件 PDF | 选不中,整页就是一张图 | 必须先做 OCR 才谈得上翻译 |
| 带 OCR 层的扫描件 | 能选中,但高亮和字有偏移 | 文件里已有一层隐藏文字,正是译后出现双层文字的原因 |
动手之前,先试着选中一行正文。这三十秒能避掉下面大部分麻烦。
第二步:设定语言对,选好模型
- 源语言手动指定,别依赖自动识别——中英混排的文档,自动识别错的时候比对的时候多
- 按文档类型选模型,而不是按跑分:见该用哪个 AI 模型
- 如果是扫描件,开始前先确认流程里包含 OCR:见扫描件怎么翻译
第三步:先锁死不该被改的内容
- 产品名、料号、法律术语,要在第一次翻译前就进术语库,而不是事后逐处改
- 公式、单位、表格里的数字应当原样带过:见怎么保住公式
- 文件太大或上传卡住,先拆分再传,别反复重试:见大文件 PDF 怎么翻译
第四步:开始翻译
上传文件,确认语言对和模型,然后开始。免费额度按页数计,不按文件体积——见免费额度包含什么。可以直接从 PDF 翻译工具开始。
第五步:只检查四个位置
不用通读全文,看这四处就够:
- 表格之后的第一页——阅读顺序最先在这里乱
- 任何分栏页面——两栏的句子被串成一句,是最常见的错法
- 一张带数字的表格——查数字,不查措辞
- 最后一页——截断总是出现在结尾
出问题时对照这张表
| 你看到的现象 | 实际发生了什么 | 去哪儿解决 |
|---|---|---|
| 乱码、段落顺序错乱 | 解析阶段结构就丢了 | PDF 翻译为什么会坏 |
| 文字互相叠在一起 | 文件里残留了隐藏的 OCR 层 | 译后出现双层文字 |
| 整份文件没被翻译 | 页面是图片,OCR 没跑起来 | 扫描件怎么翻译 |
| 上传失败或卡住 | 一次处理不下这么大的文件 | 大文件 PDF 怎么翻译 |
| 译文还需要继续编辑 | PDF 本来就不是用来编辑的格式 | PDF 转 Word |
相关工具
结论
PDF 翻译的成败,多半在点击「翻译」之前就定了:文件是文字版还是扫描件,结构能不能被完整解析出来。这两件事做对,再按四个位置抽查译文,整套方法就这些。