You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scrapy:抓取嵌套在数据单元格中带标识文本的指定链接

解决Scrapy抓取特定标注链接的问题

嘿,我来帮你搞定这个精准抓取的问题!你需要的是那个紧跟(Primary)文本的Jacob链接,原来的XPath只是批量提取所有<a>的文本,没法精准定位,我们可以利用XPath的节点关系来实现精准匹配。

方案一:通过兄弟文本节点直接定位

直接用这个XPath就能拿到目标链接的href属性:

item['stuff'] = response.xpath('//div[@id="mainBody"]/table/tr/td[contains(text(), "(Primary)")]/preceding-sibling::a[1]/@href').get()

拆解逻辑:

  1. 定位目标单元格://div[@id="mainBody"]/table/tr/td[contains(text(), "(Primary)")] 先找到包含(Primary)文本的<td>
  2. 找到紧邻的前序<a>:/preceding-sibling::a[1] 选中该单元格内,(Primary)文本节点的第一个前序<a>兄弟节点(也就是Jacob的链接)
  3. 提取链接属性:/@href 直接获取这个<a>的href值

方案二:通过文本内容+后续验证(更严谨)

如果怕页面有其他类似结构,也可以先锁定文本为"Jacob"的<a>,再验证它后面是否跟着(Primary):

item['stuff'] = response.xpath('//div[@id="mainBody"]/table/tr/td/a[text()="Jacob" and following-sibling::text()[contains(., "(Primary)")]]/@href').get()

逻辑说明:

  • text()="Jacob" 筛选出文本恰好是"Jacob"的<a>标签
  • following-sibling::text()[contains(., "(Primary)")] 确保这个<a>的下一个兄弟文本节点里包含(Primary),避免误抓同名链接

替换原有代码的注意点

原来的extract()会返回所有<a>的文本列表,而上面的get()会直接返回单个目标链接(如果需要返回列表格式可以用getall(),但这里单个结果更符合你的需求)。

内容的提问来源于stack exchange,提问作者johntd78

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.15 06:28:58