如何使用Python提取网页图片src并拼接为完整可访问URL
你可以遍历获取到的img标签对象,提取src属性后和站点域名拼接即可,推荐使用urllib.parse.urljoin处理路径拼接,避免手动拼接出现格式错误。
完整实现代码
import requests from bs4 import BeautifulSoup from urllib.parse import urljoin # 站点根域名 base_url = 'https://kvartiry-bolgarii.ru/' rs = requests.get('https://kvartiry-bolgarii.ru/neveroyatnaya-kvartira-s-vidom-na-more-tip-pentkhaus-o26253') root = BeautifulSoup(rs.content, 'html.parser') img_tags = root.select('#slider > li > img[src]') # 提取src并拼接完整链接 full_img_urls = [urljoin(base_url, img.get('src')) for img in img_tags] print(full_img_urls)
关键逻辑说明
- 每个通过
select得到的元素都是BeautifulSoup的Tag对象,调用get('src')即可获取标签的src属性值,也可以用img['src']读取,前者在属性不存在时会返回None不会抛出异常 urljoin会自动处理根域名和相对路径的拼接逻辑,不需要手动处理首尾斜杠的匹配问题
内容的提问来源于stack exchange,提问作者Дмитрий
相关产品推荐
相关产品推荐

