Scrapy中如何用CSS选择器提取包含子标签的嵌套文本?
解决Scrapy提取包含子标签的完整文本问题
嗨,这个问题我之前也踩过坑!你现在用的response.css('div.article >p::text ').extract()只能拿到<p>标签本身的直接文本节点,像<strong>这种子标签里的文本会被漏掉,所以才只得到部分内容。给你几个实用的解决办法:
方法1:选中所有后代文本节点后拼接
通过CSS选择器选中<p>下所有后代的文本节点,再过滤掉空白内容后拼接成完整字符串:
# 获取所有文本片段 text_fragments = response.css('div.article p ::text').getall() # 过滤空内容并拼接 full_text = ' '.join(frag.strip() for frag in text_fragments if frag.strip())
这里的关键是p ::text(注意p和::text之间的空格),它会匹配<p>标签下所有层级的文本节点,包括子标签<strong>里的内容。
方法2:用XPath的string()方法(更简洁)
Scrapy支持CSS选择器和XPath混合使用,string()方法可以直接提取当前节点及其所有子节点的完整文本,一步到位:
full_text = response.css('div.article p').xpath('string()').get().strip()
这个方法会自动把<p>里的所有文本(包括子标签内容)合并成一个字符串,不需要手动拼接,非常高效。
为什么原来的方法不行?
你之前写的div.article >p::text没有空格,只会匹配<p>标签自身的直接文本节点,也就是"Lorem "和" si ammet",而<strong>里的"ipsum"属于子节点的文本,自然不会被选中。
内容的提问来源于stack exchange,提问作者Yurii
相关产品推荐
相关产品推荐

