Scrapy:抓取嵌套在数据单元格中带标识文本的指定链接
解决Scrapy抓取特定标注链接的问题
嘿,我来帮你搞定这个精准抓取的问题!你需要的是那个紧跟(Primary)文本的Jacob链接,原来的XPath只是批量提取所有<a>的文本,没法精准定位,我们可以利用XPath的节点关系来实现精准匹配。
方案一:通过兄弟文本节点直接定位
直接用这个XPath就能拿到目标链接的href属性:
item['stuff'] = response.xpath('//div[@id="mainBody"]/table/tr/td[contains(text(), "(Primary)")]/preceding-sibling::a[1]/@href').get()
拆解逻辑:
- 定位目标单元格:
//div[@id="mainBody"]/table/tr/td[contains(text(), "(Primary)")]先找到包含(Primary)文本的<td> - 找到紧邻的前序
<a>:/preceding-sibling::a[1]选中该单元格内,(Primary)文本节点的第一个前序<a>兄弟节点(也就是Jacob的链接) - 提取链接属性:
/@href直接获取这个<a>的href值
方案二:通过文本内容+后续验证(更严谨)
如果怕页面有其他类似结构,也可以先锁定文本为"Jacob"的<a>,再验证它后面是否跟着(Primary):
item['stuff'] = response.xpath('//div[@id="mainBody"]/table/tr/td/a[text()="Jacob" and following-sibling::text()[contains(., "(Primary)")]]/@href').get()
逻辑说明:
text()="Jacob"筛选出文本恰好是"Jacob"的<a>标签following-sibling::text()[contains(., "(Primary)")]确保这个<a>的下一个兄弟文本节点里包含(Primary),避免误抓同名链接
替换原有代码的注意点
原来的extract()会返回所有<a>的文本列表,而上面的get()会直接返回单个目标链接(如果需要返回列表格式可以用getall(),但这里单个结果更符合你的需求)。
内容的提问来源于stack exchange,提问作者johntd78
相关产品推荐
相关产品推荐

