如何用正则表达式提取URI中指定的Base64字符串?
问题需求
现有完整URI:
https://example.com/entry/#/view/TCMaftR7cPYyC3q61TnI6_Mx8PwDTsnVyo9Z6nsXHDRzrN5ftuXxHN7NvIGK34-z/366792786/aHR0cHM6Ly9lcGwuaXJpY2EuZ292LmlyL0ltZWlBZnRlclJlZ2lzdGVyP2ltZWk9MzU5NzQ0MzkxMDc2Mjg4
需要提取/view/之后、数字段(示例中为366792786)之前的Base64字符串,目标内容:
TCMaftR7cPYyC3q61TnI6_Mx8PwDTsnVyo9Z6nsXHDRzrN5ftuXxHN7NvIGK34-z
当前使用的Perl代码:
my $uri = "https://example.com/entry/#/view/TCMaftR7cPYyC3q61TnI6_Mx8PwDTsnVyo9Z6nsXHDRzrN5ftuXxHN7NvIGK34-z/366792786/aHR0cHM6Ly9lcGwuaXJpY2EuZ292LmlyL0ltZWlBZnRlclJlZ2lzdGVyP2ltZWk9MzU5NzQ0MzkxMDc2Mjg4"; if ($uri =~ m/view\/(.+)\//g) { print $&; }
执行结果不符合预期,得到:
view/TCMaftR7cPYyC3q61TnI6_Mx8PwDTsnVyo9Z6nsXHDRzrN5ftuXxHN7NvIGK34-z/366792786/
正确实现方案
问题原因
原正则中的.+是贪婪匹配,会尽可能抓取最长的符合规则内容,导致从/view/后第一个/一直匹配到倒数第二个/,最终包含了后面的数字段;同时打印$&会输出整个匹配的内容(包括view/和末尾的/),而非目标捕获组。
修正后的代码方案
方案一:非贪婪匹配
将.+改为.+?,让匹配尽可能短,同时打印捕获组$1而非$&:
my $uri = "https://example.com/entry/#/view/TCMaftR7cPYyC3q61TnI6_Mx8PwDTsnVyo9Z6nsXHDRzrN5ftuXxHN7NvIGK34-z/366792786/aHR0cHM6Ly9lcGwuaXJpY2EuZ292LmlyL0ltZWlBZnRlclJlZ2lzdGVyP2ltZWk9MzU5NzQ0MzkxMDc2Mjg4"; if ($uri =~ m/view\/(.+?)\//) { print $1; }
方案二:精确匹配Base64字符范围
直接匹配URL安全的Base64字符(大小写字母、数字、_、-),避免意外匹配无关内容:
my $uri = "https://example.com/entry/#/view/TCMaftR7cPYyC3q61TnI6_Mx8PwDTsnVyo9Z6nsXHDRzrN5ftuXxHN7NvIGK34-z/366792786/aHR0cHM6Ly9lcGwuaXJpY2EuZ292LmlyL0ltZWlBZnRlclJlZ2lzdGVyP2ltZWk9MzU5NzQ0MzkxMDc2Mjg4"; if ($uri =~ m/view\/([A-Za-z0-9_\-]+)\//) { print $1; }
执行结果
两种方案均能输出预期的目标字符串:
TCMaftR7cPYyC3q61TnI6_Mx8PwDTsnVyo9Z6nsXHDRzrN5ftuXxHN7NvIGK34-z
内容的提问来源于stack exchange,提问作者Dan
相关产品推荐
相关产品推荐

