如何使用Beautiful Soup按指定格式提取script标签的src链接
你可以直接参考原有写法调整如下,两种可选写法分别对应你要的两种返回格式:
写法1:返回键为script的格式
tags = [{tag.name: tag['src'].strip()} for tag in soup.find_all('script', src=True)]
写法2:返回键为script src的格式
tags = [{'script src': tag['src'].strip()} for tag in soup.find_all('script', src=True)]
代码说明:
soup.find_all('script', src=True)会过滤掉所有没有src属性的script标签,避免获取src时出现KeyError异常tag['src']是BeautifulSoup中获取标签属性的标准写法,和你之前获取tag.text的逻辑对应- 保留了
strip()方法,和你原有h2提取的逻辑一致,自动去掉src值首尾的空白字符
用你提供的示例HTML运行上述代码,输出结果完全符合你给出的期望格式。
内容的提问来源于stack exchange,提问作者Rikky Bhai
相关产品推荐
相关产品推荐

