如何扩展正则表达式以匹配完整的blogger.googleusercontent.com图片URL?
匹配包含/img/a/或/img/b/的完整Blogger图片URL
需求说明
从混杂大量HTML标签的文本中,提取完整的blogger.googleusercontent.com图片URL,需满足:
- URL必须包含
/img/a/或/img/b/子目录 - URL位于
href="..."或src="..."属性中,需匹配从https开头到闭合双引号前的全部内容
解决方案正则表达式
https://blogger\.googleusercontent\.com/img/(a|b)/[^"]+
正则拆解
https://blogger\.googleusercontent\.com/:匹配URL的固定域名前缀,.用反斜杠转义,避免匹配任意字符img/(a|b)/:精准匹配/img/a/或/img/b/子目录,通过分组(a|b)实现二选一[^"]+:匹配双引号前的所有非引号字符,确保获取完整的URL内容(因为URL被双引号包裹,直到下一个引号结束)
问题修正说明
你之前使用的\/img\/a\/[^\/]存在三个核心问题:
- 仅匹配
/img/a/目录,未覆盖/img/b/ - 匹配范围极小,仅能捕获
/img/a/后的第一个非斜杠字符 - 未包含URL的前缀(
https://blogger.googleusercontent.com)和后缀(到闭合引号的全部内容)
内容的提问来源于stack exchange,提问作者user5853892
相关产品推荐
相关产品推荐

