You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python爬取爱尔兰1911年人口普查数据遇ReadTimeoutError报错求解

你的代码触发超时主要是两个核心问题:一是无限制高频请求触发了目标站点的反爬限制,服务器主动拒绝响应导致连接超时;二是未设置请求超时阈值、没有重试机制,单次请求无响应就直接抛出错误。

具体优化方案

  • 配置合理的超时参数与重试机制:给requests.get()添加timeout参数,设置10-15秒的超时阈值,同时搭配重试逻辑,超时后等待几秒再次尝试请求同页面,避免单次网络波动导致爬取中断。
  • 添加请求间隔与请求头伪装:每次请求完成后随机休眠1-3秒,降低请求频率避免触发反爬;同时在请求中添加模拟浏览器的User-Agent头,避免被站点直接识别为爬虫拦截。
  • 完善异常捕获范围:你当前仅捕获了TimeoutError,实际爬取过程中还可能出现连接错误、HTTP状态码错误等问题,需要扩大异常捕获范围,避免程序意外终止。
  • 增量存储数据:不要等到全部页面爬取完成后再统一导出,每爬取10-20页就备份一次数据,避免程序崩溃后丢失已爬取的内容。

修改后可直接运行的代码

import requests
import pandas as pd
import time
import random
from requests.adapters import HTTPAdapter
from urllib3.util.retry import Retry

# 配置请求会话,添加自动重试
session = requests.Session()
retry_strategy = Retry(
    total=3,  # 单页最多重试3次
    backoff_factor=1,  # 重试间隔按1s/2s/4s递增
    status_forcelist=[429, 500, 502, 503, 504]  # 对应状态码触发自动重试
)
adapter = HTTPAdapter(max_retries=retry_strategy)
session.mount("http://", adapter)
session.mount("https://", adapter)

# 模拟浏览器请求头,避免被识别为爬虫
headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/118.0.0.0 Safari/537.36"
}

# 基础请求地址
base_url = "http://www.census.nationalarchives.ie/search/results.jsp?census_year=1911&surname=&exact=&firstname=&county19011911=&county1821=&county1831=&county1841=&county1851=&townland=&ded=&age=&sex=&relationToHead=&religion=&education=&occupation=&marriageStatus=&marriageYears=&childrenBorn=&childrenLiving=&birthplace=&language=&deafdumb=&search=Search&sort=&pageSize=100&houseNumber=&familiesNumber=&malesNumber=&femalesNumber=&maleServNumber=&femaleServNumber=&estChurchNumber=&romanCatNumber=&presbNumberDiv=&protNumber=&parish=&barony=&yearsMarried=&causeOfDeath=&yearOfDeath=&familyId=&ageInMonths=&pager.offset={}"

# 爬取第一页初始化数据表
res = session.get(base_url.format(100), headers=headers, timeout=15)
og_table = pd.read_html(res.text)[0]

# 遍历剩余所有页面
for i in range(200, 4384418, 100):
    try:
        res = session.get(base_url.format(i), headers=headers, timeout=15)
        res.raise_for_status()  # 自动校验HTTP请求是否成功
        current_table = pd.read_html(res.text)[0]
        # 拼接数据,忽略原索引避免重复
        og_table = pd.concat([og_table, current_table], ignore_index=True)
        
        # 每爬10页备份一次数据,避免程序崩溃丢失已爬内容
        if i % 1000 == 0:
            og_table.to_excel(f"irish_output_1911_backup_{i}.xlsx", index=False)
            print(f"已爬取到偏移量{i},完成数据备份")
        
        # 随机休眠1-3秒,降低请求频率
        time.sleep(random.uniform(1, 3))
    
    except Exception as e:
        print(f"偏移量{i}爬取失败,错误信息:{str(e)}")
        # 爬取失败后多休眠5秒再继续,避免触发更严格的反爬
        time.sleep(5)
        continue

# 最终导出全量数据
og_table.to_excel("irish_output_1911_final.xlsx", index=False)

补充说明:全量数据量较大,如果超出Excel单表行数上限,建议替换为CSV格式存储;如果后续出现IP封禁问题,可搭配代理IP使用。

内容的提问来源于stack exchange,提问作者Jonah

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 01:36:04