使用pypandoc.convert_file将docx转txt时如何关闭表格列文本自动换行
pypandoc转docx为txt关闭自动换行方法
调用pypandoc.convert_file时可以通过extra_args传入pandoc原生参数实现关闭自动换行,核心是添加--wrap=none参数,该参数会禁用pandoc纯文本输出默认的按固定宽度硬换行逻辑,不会再拆分跨行单词。
修改后的可直接运行代码如下:
f = 'some file.docx' o = pypandoc.convert_file( f, 'plain', outputfile='file.txt', extra_args=['--wrap=none'] ) assert o == '', o
参数说明
- pandoc输出纯文本时默认启用72字符宽度自动硬换行,用于适配终端阅读场景,这就是表格内单词被拆分、跨行列内容错位的直接原因。
--wrap=none参数会关闭所有自动插入的硬换行,仅保留原文本身的段落、手动换行标记,输出效果和MS Word手动另存为无换行txt完全一致,不存在单词拆分问题,可直接用于程序解析。- 若存在极长单行内容,可额外在
extra_args中添加--columns=100000参数,将单行最大宽度阈值拉到足够大,避免极端场景下的意外换行。
内容的提问来源于stack exchange,提问作者SergL
相关产品推荐
相关产品推荐

