Azure Document Translation能否实现PDF文档的部分内容翻译?
Azure Document Translation能否实现PDF文档的部分内容翻译?
您好,针对您的问题,目前Azure Document Translation在控制台或直接API调用中,确实没有原生支持直接标记PDF内特定区域跳过翻译的功能,但我们可以通过一些间接方案来实现您的需求,完全不需要修改生成PDF的第三方应用:
方案一:转格式标记后再翻译(适合页面内部分内容排除)
- 先用Azure Form Recognizer的布局分析API把PDF转换成带完整格式的Word文档,这个工具能很好地保留原PDF的排版结构,避免格式混乱
- 在Word文档里,给不需要翻译的文本设置「不翻译」标记——可以通过Word“审阅”选项卡中的“标记为不翻译”功能,或者给目标文本应用特定样式后,在翻译时指定排除该样式
- 将处理后的Word文档上传到Azure Document Translation服务,它会识别这些标记并自动跳过对应内容的翻译
- 最后把翻译完成的Word文档转回PDF即可,基本能还原原文档的格式
方案二:指定页码范围翻译(适合整页排除的场景)
如果您不需要翻译的内容刚好是整页或者连续的页码段,可以在调用Azure Document Translation API时,通过pages参数指定要翻译的页码范围。比如原PDF有5页,只想翻译第1、3、5页,就可以在请求里设置pages: "1,3,5",这样服务只会处理指定页码的内容。不过这个方法只适用于整页排除的情况,无法处理单页内的部分内容。
方案三:结合文本API做精细化翻译控制
如果您需要更精准的区域控制,可以这样操作:
- 用Azure Form Recognizer提取PDF中的所有文本块,同时获取每个文本块的位置信息
- 自行判断哪些文本块需要翻译,哪些需要保留原文
- 对需要翻译的文本块单独调用Azure Translator Text API完成翻译
- 最后用PDF编辑工具把翻译后的文本块替换回原PDF的对应位置,完成部分翻译的PDF输出
另外您提到ChatGPT提到的标记功能,可能是混淆了其他翻译服务的预览功能或者旧版特性,目前Azure Document Translation确实没有直接在PDF上标记不翻译区域的原生功能,上述方案是当前可行的替代方法。
备注:内容来源于stack exchange,提问作者user2205623
相关产品推荐
相关产品推荐

