Python调用SEC EDGAR API获取申报数据遇问题求助
解决SEC EDGAR API拉取数据时的403和JSONDecodeError问题
核心问题分析
- JSONDecodeError:你调用的
browse-edgar接口默认返回HTML页面,而非JSON格式,必须添加fmt="json"参数才能获取JSON响应。 - 403禁止访问:SEC的API要求请求头必须包含
User-Agent,需明确标注你的邮箱或联系方式,否则会被服务器拦截。 - 日期参数逻辑错误:你把起始和结束日期写反了,
dateb代表「文件提交日期早于该日期」,若要拉取2020-12-31至2022-01-01的10-K报告,需配合datea(提交日期晚于该日期)参数使用。
修正后的代码
import requests import pandas as pd import numpy as np ticker = "AAPL" start_date = "2020-12-31" # 文件提交日期晚于该时间 end_date = "2022-01-01" # 文件提交日期早于该时间 sec_url = "https://www.sec.gov/cgi-bin/browse-edgar" sec_params = { "action": "getcompany", "CIK": ticker, "type": "10-k", "datea": start_date, # 新增:指定提交日期的起始点 "dateb": end_date, "owner": "exclude", "count": 100, "fmt": "json" # 新增:指定返回JSON格式 } # 必须设置User-Agent,替换为你的真实邮箱 headers = { "User-Agent": "Your Name your.email@example.com" } sec_response = requests.get(sec_url, params=sec_params, headers=headers) sec_data = sec_response.json() # 转换为DataFrame并查看关键字段 if "filings" in sec_data and "recent" in sec_data["filings"]: df = pd.DataFrame(sec_data["filings"]["recent"]) print(df[["formType", "filingDate", "accessionNumber"]].head()) else: print("未获取到有效报告数据")
额外说明
User-Agent必须填写真实信息,SEC以此识别合法请求,避免IP被封禁。- 若要下载具体的10-K报告内容,可从返回的JSON数据中提取
accessionNumber和primaryDocument字段,拼接成下载链接后再次发起请求。 - EDGAR接口的逻辑是先通过索引接口获取文件列表,再根据列表中的信息下载具体报告,逐步拆解即可完成分析流程。
内容的提问来源于stack exchange,提问作者SPR26
相关产品推荐
相关产品推荐

