使用正则表达式从URL字符串中提取PDF文件名
提取目标PDF文件名的方法
首先先看你提供的原始URL字符串:
/Portals/0/Documents/MFG_Datasheet_Work%20and%20Asset.pdf?ver=2018-03-18-111121-810
要提取/Documents/后的PDF文件名并移除?ver=及后续内容,分这几步就能轻松搞定:
- 第一步:先截取
/Documents/之后的所有内容,得到:MFG_Datasheet_Work%20and%20Asset.pdf?ver=2018-03-18-111121-810 - 第二步:找到
?ver=的位置,截断它前面的部分,得到URL编码的文件名:MFG_Datasheet_Work%20and%20Asset.pdf - 第三步:把URL里的
%20(代表空格)替换成实际空格,最终得到MFG_Datasheet_Work and Asset.pdf
如果想用代码自动处理的话,拿Python举个例子,这段代码能直接输出结果:
raw_url = "/Portals/0/Documents/MFG_Datasheet_Work%20and%20Asset.pdf?ver=2018-03-18-111121-810" # 提取Documents后的片段 post_docs = raw_url.split("/Documents/")[1] # 截断版本参数部分 encoded_filename = post_docs.split("?ver=")[0] # 解码URL空格 final_name = encoded_filename.replace("%20", " ") print(final_name)
运行这段代码就能得到干净的PDF文件名啦!
内容的提问来源于stack exchange,提问作者Dude Marketing
相关产品推荐
相关产品推荐

