You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python爬虫如何提取网页h1标签内的纯文本产品标题?

Python爬虫BeautifulSoup提取标签文本解决方案

你调用soup.find()方法得到的是BeautifulSoup的Tag对象,直接打印会输出完整的HTML标签结构,要获取标签内部的纯文本内容,调用对应属性即可,完整修改方案如下:

核心修改点

  • 补充导入requests依赖:原代码使用了requests.get()但未导入对应库,直接运行会报错
  • 提取文本替换:使用Tag对象的text属性或者get_text()方法,即可拿到标签内的纯文本
  • 可选文本处理:如果需要过滤后缀(10pcs)仅保留CHERRY MX SILENT RED,可通过字符串切割实现

完整可运行代码

import requests
from bs4 import BeautifulSoup

URL = 'https://kbdfans.com/collections/cherry-switches/products/cherry-mx-silent-red'

headers = {"User-Agent": 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/94.0.4606.81 Safari/537.36'}

page = requests.get(URL, headers=headers)
soup = BeautifulSoup(page.content, 'html.parser')

title_tag = soup.find('h1', {'class' : 'product-detail__title small-title'})
# 获取标签内完整文本,strip清除首尾多余空格换行
full_title = title_tag.text.strip()
# 仅保留括号前的产品名
product_name = full_title.split('(')[0].strip()

print(product_name)

运行上述代码即可输出你需要的CHERRY MX SILENT RED内容。如果不需要过滤后缀,直接打印full_title即可。

内容的提问来源于stack exchange,提问作者MrSirDolphin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 04:24:02