You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scrapy爬取CVE页面表格数据返回空数组,求绕过方法

解决Scrapy爬取MITRE CVE表格tbody为空的问题

问题描述

我正在使用Scrapy爬取链接为https://cve.mitre.org/cgi-bin/cvekey.cgi?keyword=hp的页面,尝试提取主表格的所有行。使用XPath表达式//div[@id='TableWithRules']//tbody/tr本应得到目标结果,但在Scrapy Shell中测试发现,response.xpath("//div[@id='TableWithRules']//tbody").extract()返回空数组,而response.xpath("//div[@id='TableWithRules']//thead").extract()能正常获取内容。推测网站对表格数据爬取做了限制,请问是否有可行的解决办法?

可行解决办法

  • 跳过tbody直接定位数据行:很多浏览器会自动给表格补全<tbody>标签,但原始HTML里可能根本没有这个节点。直接用//div[@id='TableWithRules']//tr提取所有行,再过滤掉表头行即可。示例代码:

    # 跳过thead里的第一行表头,直接取数据行
    rows = response.xpath("//div[@id='TableWithRules']//tr[position()>1]")
    
  • 核对原始HTML结构:在Scrapy Shell里执行view(response)打开页面,查看原始HTML源码(不要用浏览器开发者工具,因为浏览器会自动修正DOM结构),确认表格的真实层级——大概率数据行直接在<table>标签下,没有tbody包裹。

  • 模拟真实浏览器请求:如果网站有基础反爬限制,可在Scrapy的settings.py中配置浏览器UA和请求延迟,让请求更贴近真实用户行为:

    DOWNLOAD_DELAY = 2
    USER_AGENT = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36'
    
  • 用Splash渲染动态内容:如果表格数据是通过JavaScript动态加载的,需要配置Scrapy Splash,用SplashRequest替代普通Request,获取渲染后的完整HTML再提取数据。

内容的提问来源于stack exchange,提问作者Rodolfo

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.05 10:22:33