You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scrapy中如何用CSS选择器提取包含子标签的嵌套文本?

解决Scrapy提取包含子标签的完整文本问题

嗨,这个问题我之前也踩过坑!你现在用的response.css('div.article >p::text ').extract()只能拿到<p>标签本身的直接文本节点,像<strong>这种子标签里的文本会被漏掉,所以才只得到部分内容。给你几个实用的解决办法:

方法1:选中所有后代文本节点后拼接

通过CSS选择器选中<p>下所有后代的文本节点,再过滤掉空白内容后拼接成完整字符串:

# 获取所有文本片段
text_fragments = response.css('div.article p ::text').getall()
# 过滤空内容并拼接
full_text = ' '.join(frag.strip() for frag in text_fragments if frag.strip())

这里的关键是p ::text(注意p和::text之间的空格),它会匹配<p>标签下所有层级的文本节点,包括子标签<strong>里的内容。

方法2:用XPath的string()方法(更简洁)

Scrapy支持CSS选择器和XPath混合使用,string()方法可以直接提取当前节点及其所有子节点的完整文本,一步到位:

full_text = response.css('div.article p').xpath('string()').get().strip()

这个方法会自动把<p>里的所有文本(包括子标签内容)合并成一个字符串,不需要手动拼接,非常高效。

为什么原来的方法不行?

你之前写的div.article >p::text没有空格,只会匹配<p>标签自身的直接文本节点,也就是"Lorem "和" si ammet",而<strong>里的"ipsum"属于子节点的文本,自然不会被选中。

内容的提问来源于stack exchange,提问作者Yurii

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.21 04:26:19