如何从多类别网站抓取指定class为project的href链接?
筛选class为"project"的站内链接
你需要在findAll中添加筛选参数,精准定位带有class="project"的<a>标签,同时可以额外过滤出站内链接,避免无关结果:
修改后的代码如下:
for link in soup.findAll("a", class_="project"): href = link.get('href') # 只保留站内相对路径链接 if href and href.startswith('/'): print(href)
关键说明:
- 使用
class_="project"作为筛选条件,因为class是Python的保留关键字,所以BeautifulSoup用class_来指定标签的class属性 - 增加
href.startswith('/')判断,确保只输出站内的相对路径链接,排除外部跳转链接
内容的提问来源于stack exchange,提问作者Taran Harish
相关产品推荐
相关产品推荐

