基于requests模块的PDF下载脚本仅部分下载文件,如何实现完整下载?
解决PDF下载不完整的问题
你的脚本出现部分下载的情况,通常是请求未获取完整响应、连接中断或服务器分块数据读取不彻底导致的。可以通过以下优化强制完成完整下载:
关键优化步骤
- 校验请求状态:先确认请求是否成功,避免在错误响应下继续下载
- 验证文件完整性:对比响应头的文件大小与本地写入大小,不一致则重新尝试
- 添加超时与重试:防止连接超时中断,失败时自动重试
- 优化流式读取:处理服务器分块传输场景,提升读取稳定性
修改后的完整脚本
import requests from requests.adapters import HTTPAdapter from urllib3.util.retry import Retry def download_pdf(url, save_path, max_retries=3): # 配置重试策略 session = requests.Session() retry = Retry( total=max_retries, backoff_factor=1, status_forcelist=[429, 500, 502, 503, 504] ) adapter = HTTPAdapter(max_retries=retry) session.mount('http://', adapter) session.mount('https://', adapter) headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/103.0.0.0 Safari/537.36', } try: # 发送请求,设置超时,允许重定向 with session.get(url, headers=headers, stream=True, timeout=30) as res: # 校验请求是否成功 res.raise_for_status() # 获取预期文件大小(服务器返回的情况下) expected_size = int(res.headers.get('Content-Length', 0)) downloaded_size = 0 with open(save_path, 'wb') as f: for chunk in res.iter_content(chunk_size=8192): # 增大块大小提升效率 if chunk: downloaded_size += len(chunk) f.write(chunk) # 验证文件完整性(有预期大小的情况下) if expected_size > 0 and downloaded_size != expected_size: raise Exception(f"文件下载不完整:预期{expected_size}字节,实际下载{downloaded_size}字节") print("文件下载完成") except Exception as e: print(f"下载失败: {str(e)}") # 可选:删除不完整的文件 # import os # if os.path.exists(save_path): # os.remove(save_path) return False return True # 调用下载函数 pdf_url = 'http://www.sidney.ca/Assets/Active+Development+Applications/2021/9633_Third_Street_Plans.pdf' download_pdf(pdf_url, 'Third_Street_Plans.pdf')
优化点说明
- 重试机制:通过
requests.Session和Retry配置,遇到服务器错误或超时自动重试,提升下载成功率 - 超时设置:设置
timeout=30避免连接长时间无响应卡住 - 完整性校验:对比响应头返回的
Content-Length与实际写入大小,确保文件完整 - 块大小优化:将
chunk_size从1024改为8192,减少IO操作次数,提升下载效率 - 异常捕获:处理请求和下载过程中的异常,及时反馈问题
内容的提问来源于stack exchange,提问作者MITHU
相关产品推荐
相关产品推荐

