Scrapy爬取CVE页面表格数据返回空数组,求绕过方法
问题描述
我正在使用Scrapy爬取链接为
https://cve.mitre.org/cgi-bin/cvekey.cgi?keyword=hp的页面,尝试提取主表格的所有行。使用XPath表达式//div[@id='TableWithRules']//tbody/tr本应得到目标结果,但在Scrapy Shell中测试发现,response.xpath("//div[@id='TableWithRules']//tbody").extract()返回空数组,而response.xpath("//div[@id='TableWithRules']//thead").extract()能正常获取内容。推测网站对表格数据爬取做了限制,请问是否有可行的解决办法?
可行解决办法
跳过tbody直接定位数据行:很多浏览器会自动给表格补全
<tbody>标签,但原始HTML里可能根本没有这个节点。直接用//div[@id='TableWithRules']//tr提取所有行,再过滤掉表头行即可。示例代码:# 跳过thead里的第一行表头,直接取数据行 rows = response.xpath("//div[@id='TableWithRules']//tr[position()>1]")核对原始HTML结构:在Scrapy Shell里执行
view(response)打开页面,查看原始HTML源码(不要用浏览器开发者工具,因为浏览器会自动修正DOM结构),确认表格的真实层级——大概率数据行直接在<table>标签下,没有tbody包裹。模拟真实浏览器请求:如果网站有基础反爬限制,可在Scrapy的
settings.py中配置浏览器UA和请求延迟,让请求更贴近真实用户行为:DOWNLOAD_DELAY = 2 USER_AGENT = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/114.0.0.0 Safari/537.36'用Splash渲染动态内容:如果表格数据是通过JavaScript动态加载的,需要配置Scrapy Splash,用
SplashRequest替代普通Request,获取渲染后的完整HTML再提取数据。
内容的提问来源于stack exchange,提问作者Rodolfo

