Python爬虫如何提取网页h1标签内的纯文本产品标题?
Python爬虫BeautifulSoup提取标签文本解决方案
你调用soup.find()方法得到的是BeautifulSoup的Tag对象,直接打印会输出完整的HTML标签结构,要获取标签内部的纯文本内容,调用对应属性即可,完整修改方案如下:
核心修改点
- 补充导入
requests依赖:原代码使用了requests.get()但未导入对应库,直接运行会报错 - 提取文本替换:使用
Tag对象的text属性或者get_text()方法,即可拿到标签内的纯文本 - 可选文本处理:如果需要过滤后缀
(10pcs)仅保留CHERRY MX SILENT RED,可通过字符串切割实现
完整可运行代码
import requests from bs4 import BeautifulSoup URL = 'https://kbdfans.com/collections/cherry-switches/products/cherry-mx-silent-red' headers = {"User-Agent": 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/94.0.4606.81 Safari/537.36'} page = requests.get(URL, headers=headers) soup = BeautifulSoup(page.content, 'html.parser') title_tag = soup.find('h1', {'class' : 'product-detail__title small-title'}) # 获取标签内完整文本,strip清除首尾多余空格换行 full_title = title_tag.text.strip() # 仅保留括号前的产品名 product_name = full_title.split('(')[0].strip() print(product_name)
运行上述代码即可输出你需要的CHERRY MX SILENT RED内容。如果不需要过滤后缀,直接打印full_title即可。
内容的提问来源于stack exchange,提问作者MrSirDolphin
相关产品推荐
相关产品推荐

