You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scrapy爬虫调用XPath抓取邮箱时提示无效表达式错误

报错原因
  • XPath表达式语法错误:你写的路径里括号数量不匹配,末尾缺少1个闭合右括号,且在div/后多写了1个无效左括号,直接触发无效路径表达式异常;同时XPath路径规则不允许在斜杠分隔的路径步骤里直接衔接括号包裹的函数,写法不符合规范。
  • 选择器调用逻辑缺失:Scrapy的.xpath()方法返回的是Selector列表/对象,不调用提取方法无法拿到实际的文本值,就算XPath写对了也拿不到邮箱字符串。
修复后的代码

直接替换你parse_book方法里的内容即可:

def parse_book(self, response):
    data = response.xpath(
        "//span[contains(text(),'Email')]/following-sibling::div[1]/concat(@data-ea, '@', @data-eb)"
    ).get()

    yield {
        'email': data
    }
逻辑说明
  • 修正后的XPath先定位到包含Email文本的span标签,取它后面紧邻的第一个div节点(加[1]是为了避免匹配到页面其他无关div,提升提取准确率),直接在该节点上调用concat函数拼接两个反爬属性和@符号,得到完整邮箱。
  • 末尾加.get()方法直接提取匹配到的第一个字符串结果,符合Scrapy选择器的使用规范。
  • 你原有代码里的列表页链接提取、爬取延迟、UA配置都没有问题,不需要修改。

内容的提问来源于stack exchange,提问作者Amen Aziz

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.27 21:27:46