遍历GitHub市场链接爬取数据时requests.get报错排查
问题解决:requests.exceptions.InvalidSchema 报错修复
问题根源
你在循环爬取时犯了个低级错误——把整个df_actionname['Weblink']这个Pandas Series对象直接传给了requests.get(),而不是每次迭代取单个链接字符串。requests库根本不认Series这种格式,自然就抛出了No connection adapters were found for...的错误。
修复代码
错误写法(别再这么写了)
# 错误示例:用整个Series当URL for _ in df_actionname['Weblink']: detailpage = requests.get(df_actionname['Weblink'])
正确写法
遍历Weblink列的每个元素,每次传入单个链接:
import requests # 逐个取出Weblink列里的每个URL for url in df_actionname['Weblink']: # 先检查URL有没有http/https前缀,避免额外报错 if not url.startswith(('http://', 'https://')): print(f"URL格式不对:{url},直接跳过") continue try: detailpage = requests.get(url) # 这里写你处理页面数据的逻辑 print(f"成功拿到 {url} 的数据") except requests.exceptions.RequestException as e: print(f"爬 {url} 失败了:{str(e)}")
额外提醒
- 一定要保证每个
Weblink都是完整的URL,必须带http://或https://前缀,不然就算传单个字符串也会触发同样的错误。 - 加上try-except捕获异常,防止某个链接爬取失败导致整个循环直接崩掉。
内容的提问来源于stack exchange,提问作者JJH
相关产品推荐
相关产品推荐

