如何使用XPath提取含tabindex="0"的post-title类a标签文本?
解决方法
精准提取目标文本
目标文本位于a.post-title下的span.label子元素中,需要调整XPath指向该span并提取文本:# 获取所有匹配的文本列表 response.xpath('//a[@class="post-title"]/span[@class="label"]/text()').getall() # 获取单个匹配文本(第一个) response.xpath('//a[@class="post-title"]/span[@class="label"]/text()').get()提取a标签下所有文本(包含子元素)
如果需要获取a.post-title标签下的所有文本内容(不管嵌套结构),可以使用:response.xpath('//a[@class="post-title"]//text()').getall()排查动态加载问题
如果上述XPath仍无法获取内容,大概率是页面通过JavaScript动态渲染元素。此时可以在Scrapy Shell中启用渲染模式加载页面:scrapy shell --render 'https://newyork.craigslist.org/search/egr'加载完成后再执行之前的XPath命令。
验证元素定位准确性
先确认页面中是否存在目标元素,执行以下命令查看匹配数量:len(response.xpath('//a[@class="post-title"]'))如果返回0,说明元素定位有误,需打开浏览器开发者工具重新检查页面结构,确认class名称或元素层级是否变化。
内容的提问来源于stack exchange,提问作者Rob John
相关产品推荐
相关产品推荐

