如何移除img标签结构 仅提取保留其中的图片资源链接
提取img标签内图片链接的实现方法
- 手动提取(仅需处理少量单条数据时)
直接定位img标签内src属性后双引号包裹的内容,去掉前后双引号即可得到目标链接,你给出的示例提取结果为:https://res.cloudinary.com/dvhhqcxre/image/upload/v1611495185/zenith/tldyffcvvfm9fj51pvjp.jpg - JavaScript 批量处理实现
如果需要在前端处理字符串格式的标签或DOM节点,可使用正则匹配实现:
const imgTagStr = '<img src="https://res.cloudinary.com/dvhhqcxre/image/upload/v1611495185/zenith/tldyffcvvfm9fj51pvjp.jpg">'; const srcMatchRule = /<img[^>]+src="([^">]+)"/; const imgUrl = imgTagStr.match(srcMatchRule)[1]; console.log(imgUrl); // 输出提取到的图片链接
- Python 批量处理实现
如果是做爬虫或后端文本处理,可选择正则或BeautifulSoup库实现:
- 正则匹配实现
import re img_tag_str = '<img src="https://res.cloudinary.com/dvhhqcxre/image/upload/v1611495185/zenith/tldyffcvvfm9fj51pvjp.jpg">' src_match_rule = r'<img[^>]+src="([^">]+)"' img_url = re.findall(src_match_rule, img_tag_str)[0] print(img_url)
- BeautifulSoup 实现(更适合复杂HTML结构场景)
from bs4 import BeautifulSoup img_tag_str = '<img src="https://res.cloudinary.com/dvhhqcxre/image/upload/v1611495185/zenith/tldyffcvvfm9fj51pvjp.jpg">' soup = BeautifulSoup(img_tag_str, 'html.parser') img_url = soup.find('img')['src'] print(img_url)
内容的提问来源于stack exchange,提问作者Gabriel
相关产品推荐
相关产品推荐

