Python docx库runs对象工作机制疑问:同样式文本为何拆分多个run
python-docx同样式段落拆分为多个run的原因及注意事项
核心原因
你观察到的现象是Word文档底层存储的正常表现,和python-docx的解析逻辑无关:
- Word在输入文本的过程中,会因为自动拼写检查标记、自动更正临时记录、输入停顿、输入法选词操作等隐性行为,自动把连续输入的文本拆分为多个独立的run节点存储,哪怕这些文本的可见样式完全一致。
- python-docx的
paragraph.runs是完全按照docx文件底层XML中的<w:r>标签来返回的,只要XML中是拆分的多个<w:r>节点,就算它们的样式属性完全相同,也会返回为多个run对象。你可以把docx文件改后缀为zip解压后,查看word/document.xml内容,就能直接看到文本的拆分情况。
相关注意事项
- 不要假定「段落样式统一就只有一个run」,run的拆分逻辑由Word本身控制,和可见的文本格式没有必然绑定关系。
- 仅需要获取段落完整文本时,直接调用
paragraph.text属性即可,不需要自行拼接多个run的文本内容,避免出现意料之外的格式问题。 - 需要统一修改整段文本样式时,遍历所有run逐个修改对应样式属性即可,多个run的存在不会影响修改效果。
内容的提问来源于stack exchange,提问作者Ariel
相关产品推荐
相关产品推荐

