使用wget无法突破登录页完成全站下载的问题求助
使用wget无法突破登录页完成全站下载的问题求助
各位大佬,我最近卡在了用wget下载全站的问题上——怎么都绕不过登录页面。之前查了不少类似的问题,但大多都是好几年前的老帖子了,而且上面提到的方法我几乎都试过一遍,还是没解决问题。
我试过的方法列在下面:
- 直接通过命令行参数指定用户名和密码:
wget --user="user" --password="password" $url - 导入从Firefox导出的Netscape格式会话Cookie文件:
wget --load-cookies cookies.txt $url - 关闭机器人排除协议(这个操作是必须的,但只靠它还是没法正常爬取网站):
wget -e robots=off $url
最后我把这些参数整合起来,用了这条完整命令:wget --mirror --user=$user --password=$password -e robots=off --page-requisites --convert-link --no-clobber --no-parent --load-cookies cookies.txt $url
可就算这样,我还是卡在登录页过不去。想请教下大家,还有什么别的方法可以尝试吗?或者是不是应该换个工具来做这件事?难道这个网站对wget这类爬虫工具的防护真的做得这么严格吗?
备注:内容来源于stack exchange,提问作者kurapica
相关产品推荐
相关产品推荐

