You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从bs4.element.Tag提取文本?需提取指定<a>标签内容及示例代码

从bs4.element.Tag对象提取文本的方法

针对你提供的<a class="jobTitle-link" href="/job/Data-Engineer/861664201/">Data Engineer</a>标签,以下是三种常用的文本提取方式及示例代码:

方法1:使用.text属性

这是最常用的提取方式,会自动拼接标签下所有子节点的文本内容:

from bs4 import BeautifulSoup

html = '<a class="jobTitle-link" href="/job/Data-Engineer/861664201/">Data Engineer</a>'
soup = BeautifulSoup(html, 'html.parser')
# 定位目标标签
target_tag = soup.find('a', class_='jobTitle-link')
# 提取文本
extracted_text = target_tag.text
print(extracted_text)  # 输出: Data Engineer

方法2:使用.get_text()方法

和.text效果基本一致,但支持自定义分隔符、去除空白等参数(适合复杂结构的标签):

from bs4 import BeautifulSoup

html = '<a class="jobTitle-link" href="/job/Data-Engineer/861664201/">Data Engineer</a>'
soup = BeautifulSoup(html, 'html.parser')
target_tag = soup.find('a', class_='jobTitle-link')
# 提取文本,默认行为和.text相同
extracted_text = target_tag.get_text()
# 若标签内有多个独立文本节点,可指定分隔符,例如target_tag.get_text(' | ')
print(extracted_text)  # 输出: Data Engineer

方法3:使用.string属性

仅适用于标签下只有单个文本节点的场景,若标签包含多个子节点会返回None:

from bs4 import BeautifulSoup

html = '<a class="jobTitle-link" href="/job/Data-Engineer/861664201/">Data Engineer</a>'
soup = BeautifulSoup(html, 'html.parser')
target_tag = soup.find('a', class_='jobTitle-link')
extracted_text = target_tag.string
print(extracted_text)  # 输出: Data Engineer

内容的提问来源于stack exchange,提问作者Behruam A

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 00:41:01