浏览器访问正常但requests请求doi.org重定向至wiley失败
问题分析与解决方案
浏览器与requests请求的核心差异
- 请求头完整性:浏览器会自动携带大量额外请求头,比如
Accept、Accept-Language、Accept-Encoding、Connection、Sec-Fetch-*系列等,而requests默认仅携带少量基础头,即便修改了User-Agent也补全不了这些内容。 - Cookie上下文:浏览器访问时可能已留存该域名的有效Cookie(比如之前访问产生的会话Cookie),而你的Session虽然启用,但第一次请求直接访问目标地址,没有先获取服务器下发的初始Cookie,缺少浏览器自动处理的Cookie交互流程。
- 请求方式适配:你首次用HEAD请求时,部分服务器会对HEAD请求做拦截限制,而浏览器默认使用GET请求,且重定向过程中会自动传递所有请求头和Cookie。
需要补充的关键请求头
模拟浏览器请求需补充以下几类核心头:
headers = { 'User-Agent': 'Mozilla/5.0 (X11; Linux x86_64; rv:109.0) Gecko/20100101 Firefox/114.0', 'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/avif,image/webp,*/*;q=0.8', 'Accept-Language': 'en-US,en;q=0.5', 'Accept-Encoding': 'gzip, deflate, br', 'Connection': 'keep-alive', 'Upgrade-Insecure-Requests': '1', 'Sec-Fetch-Dest': 'document', 'Sec-Fetch-Mode': 'navigate', 'Sec-Fetch-Site': 'none', 'Sec-Fetch-User': '?1' }
修正后的请求示例
import requests headers = { 'User-Agent': 'Mozilla/5.0 (X11; Linux x86_64; rv:109.0) Gecko/20100101 Firefox/114.0', 'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/avif,image/webp,*/*;q=0.8', 'Accept-Language': 'en-US,en;q=0.5', 'Accept-Encoding': 'gzip, deflate, br', 'Connection': 'keep-alive', 'Upgrade-Insecure-Requests': '1', 'Sec-Fetch-Dest': 'document', 'Sec-Fetch-Mode': 'navigate', 'Sec-Fetch-Site': 'none', 'Sec-Fetch-User': '?1' } with requests.Session() as s: # 先请求域名主页获取初始会话Cookie s.get('https://doi.org', headers=headers) # 再请求目标DOI地址 response = s.get('https://doi.org/10.1002/jccs.200600142', headers=headers) print(response.status_code)
额外注意事项
- 避免短时间内频繁请求,防止触发服务器反爬机制。
- 最准确的模拟方式是用浏览器开发者工具(F12→Network标签)查看真实请求的所有请求头,完全复制后填入requests的headers中,能最大程度匹配浏览器行为。
内容的提问来源于stack exchange,提问作者geko
相关产品推荐
相关产品推荐

