如何解析HTML文件,定位关键词后删除其后指定数量的字符
HTML文件路径批量修改实现方法
核心匹配规则:针对给出的文件结构,data/路径后固定紧跟24位随机字符串,再接下划线和文件名,直接通过正则匹配删除这24位固定长度的随机串即可,不需要逐行遍历手动修改。
方法一:Python脚本批量处理(推荐,误改风险低)
不需要安装额外依赖,Windows/macOS/Linux都可以直接运行:
- 新建一个
.py后缀的脚本文件,把下面的代码复制进去 - 把脚本里的输入文件路径改成你自己的html文件路径,操作前建议先备份原文件
- 运行脚本,会自动生成修改后的新文件,不会覆盖原文件
import re # 替换成你自己的源文件路径 source_file = "你的源文件.html" # 修改后输出的文件路径 result_file = "修改后的文件.html" # 读取源文件内容 with open(source_file, "r", encoding="utf-8") as f: raw_content = f.read() # 正则替换:匹配data/后紧跟的24个字符,删除该段 fixed_content = re.sub(r"(data/).{24}(_)", r"\1\2", raw_content) # 保存修改后的内容 with open(result_file, "w", encoding="utf-8") as f: f.write(fixed_content) print(f"处理完成,结果已保存到 {result_file}")
方法二:文本编辑器正则替换(无需写代码)
如果你用VS Code、Notepad++这类支持正则替换的文本编辑器,可以直接操作:
- 用编辑器打开目标html文件,按
Ctrl+H调出替换面板 - 开启正则匹配模式:VS Code点击替换框旁的
.*按钮,Notepad++在查找模式里选择「正则表达式」 - 查找内容输入:
(data/).{24}(_) - 替换为输入:
$1$2 - 点击「全部替换」,抽查确认替换结果正确后保存文件即可
注意:如果你的文件里存在其他
data/开头但不符合「24位随机串+下划线」结构的路径,建议替换前先逐处预览匹配结果,避免误删内容。按照样例测试,替换后路径会从data/62b063932513a59a02f25f37_name1.jpg变为data/_name1.jpg,符合删除要求。
内容的提问来源于stack exchange,提问作者Johnny
相关产品推荐
相关产品推荐

