PY4E课程Page Spider Exercise运行报错:无法检索或解析页面求助
Page Spider Exercise 错误排查方案
修正URL输入格式
你输入的['http://www.dr-chuck.com 57']是错误格式,包含了不必要的方括号、单引号和数字57。运行程序时直接输入纯URL即可:http://www.dr-chuck.com。恢复正确的BeautifulSoup导入语句
既然安装的是BeautifulSoup 4,必须使用正确的导入代码:from bs4 import BeautifulSoupfrom BeautifulSoup import *是旧版BS3的写法,和你安装的BS4版本不兼容,会导致解析模块失效。添加请求头绕过反爬拦截
部分网站会拦截无标识的爬虫请求,修改spider.py中的请求逻辑,添加User-Agent模拟浏览器访问:
找到urllib.request.urlopen相关代码,替换为:import urllib.request req = urllib.request.Request(url, headers={'User-Agent': 'Mozilla/5.0'}) html = urllib.request.urlopen(req).read()这能避免被网站的反爬机制拒绝访问。
验证页面可达性
先手动在浏览器打开http://www.dr-chuck.com,确认页面能正常加载。如果浏览器无法访问,排查网络连接;如果能访问,检查代码中URL拼接、解析逻辑是否有语法错误。
内容的提问来源于stack exchange,提问作者davy.jones
相关产品推荐
相关产品推荐

