Scrapy爬虫调用XPath抓取邮箱时提示无效表达式错误
报错原因
- XPath表达式语法错误:你写的路径里括号数量不匹配,末尾缺少1个闭合右括号,且在
div/后多写了1个无效左括号,直接触发无效路径表达式异常;同时XPath路径规则不允许在斜杠分隔的路径步骤里直接衔接括号包裹的函数,写法不符合规范。 - 选择器调用逻辑缺失:Scrapy的
.xpath()方法返回的是Selector列表/对象,不调用提取方法无法拿到实际的文本值,就算XPath写对了也拿不到邮箱字符串。
修复后的代码
直接替换你parse_book方法里的内容即可:
def parse_book(self, response): data = response.xpath( "//span[contains(text(),'Email')]/following-sibling::div[1]/concat(@data-ea, '@', @data-eb)" ).get() yield { 'email': data }
逻辑说明
- 修正后的XPath先定位到包含Email文本的span标签,取它后面紧邻的第一个div节点(加
[1]是为了避免匹配到页面其他无关div,提升提取准确率),直接在该节点上调用concat函数拼接两个反爬属性和@符号,得到完整邮箱。 - 末尾加
.get()方法直接提取匹配到的第一个字符串结果,符合Scrapy选择器的使用规范。 - 你原有代码里的列表页链接提取、爬取延迟、UA配置都没有问题,不需要修改。
内容的提问来源于stack exchange,提问作者Amen Aziz
相关产品推荐
相关产品推荐

