You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PY4E课程Page Spider Exercise运行报错:无法检索或解析页面求助

Page Spider Exercise 错误排查方案
  • 修正URL输入格式
    你输入的['http://www.dr-chuck.com 57']是错误格式,包含了不必要的方括号、单引号和数字57。运行程序时直接输入纯URL即可:http://www.dr-chuck.com。

  • 恢复正确的BeautifulSoup导入语句
    既然安装的是BeautifulSoup 4,必须使用正确的导入代码:

    from bs4 import BeautifulSoup
    

    from BeautifulSoup import *是旧版BS3的写法,和你安装的BS4版本不兼容,会导致解析模块失效。

  • 添加请求头绕过反爬拦截
    部分网站会拦截无标识的爬虫请求,修改spider.py中的请求逻辑,添加User-Agent模拟浏览器访问:
    找到urllib.request.urlopen相关代码,替换为:

    import urllib.request
    req = urllib.request.Request(url, headers={'User-Agent': 'Mozilla/5.0'})
    html = urllib.request.urlopen(req).read()
    

    这能避免被网站的反爬机制拒绝访问。

  • 验证页面可达性
    先手动在浏览器打开http://www.dr-chuck.com,确认页面能正常加载。如果浏览器无法访问,排查网络连接;如果能访问,检查代码中URL拼接、解析逻辑是否有语法错误。

内容的提问来源于stack exchange,提问作者davy.jones

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.18 05:52:41