如何在Notepad++中用正则表达式批量删除PDF转换后出现的<数字>格式标记
如何在Notepad++中用正则表达式批量删除PDF转换后出现的<数字>格式标记
兄弟,太懂你这种PDF转文本后被一堆乱标记烦到的感觉了!你遇到的这些<数字>、</数字>格式的标签,都是PDF转换过程中带出来的排版控制标记,完全可以用Notepad++的正则表达式一次性清理干净,咱们一步步来操作:
- 第一步:打开Notepad++的替换窗口,直接按快捷键
Ctrl+H就行 - 第二步:在窗口的「查找模式」区域,一定要勾选「正则表达式」(不用勾选「.匹配换行符」,看你的例子这些标记都是单行的)
- 第三步:在「查找内容」输入框里,粘贴这个正则表达式:
</?\d+>
给你拆解下这个表达式的逻辑,方便你理解:</?:匹配开头的<,后面的/?表示这个/是可选的,这样不管是<数字>还是</数字>都能被匹配到\d+:匹配一个或多个连续的数字(正好对应标记里的数字部分)>:匹配结尾的>
- 第四步:把「替换为」输入框留空,然后点击「全部替换」,瞬间就能把文档里几千个这类标记都清掉!
举个你给的例子,原来的文本是:
<4321>Aufnahme des neuen Hilfsaggregats Frequenzumrichter Siemens Sinamic G120C (Kapitel </4321><4337>9</4337><4343> dieses Berichts)</4343>
替换后就会变成干净的内容:
Aufnahme des neuen Hilfsaggregats Frequenzumrichter Siemens Sinamic G120C (Kapitel 9 dieses Berichts)
另外说下你之前遇到的问题:为什么转义<没用?其实在Notepad++的正则模式里,<并不是具有特殊含义的正则元字符(像.、*、+这些才需要转义),所以你之前加反斜杠反而多此一举了,直接写<就能正常匹配啦!
备注:内容来源于stack exchange,提问作者NICKINNK
相关产品推荐
相关产品推荐

