如何使用正则表达式提取字符串中img标签的alt属性内容
提取HTML img标签的alt属性内容
正则解决方案
针对你给出的转义后HTML字符串,可使用以下正则表达式捕获alt属性的内容:
alt="([^&]+)"
匹配逻辑
alt=":精准匹配转义后的alt属性起始部分(对应原始HTML里的alt=")([^&]+):捕获组,匹配所有&之前的字符——因为转义后的属性值结尾是",用&作为终止符能准确锁定属性内容范围":匹配转义后的属性值结束标记
示例测试
用你提供的示例字符串:
<p>this is text<img src="https://storage.googleapis.com/staging-grapedata-task-helpful-resource-files-967a/e83759c9-85c8-4b22-b3b7-f3ab76d97f30/0c5185b7-0afd-4bca-882b-b23589fb3255_photo_2022-11-04_16-04-42.jpg%5C" alt="photo_2022-11-04_16-04-42" /> and more text</p>
运行正则后,捕获组1的结果就是预期的:photo_2022-11-04_16-04-42
针对原始HTML的扩展
如果是处理未转义的原始HTML代码,只需把正则调整为:
alt="([^"]+)"
匹配逻辑一致,只是直接针对原始双引号而非转义后的"。
内容的提问来源于stack exchange,提问作者Mykola
相关产品推荐
相关产品推荐

