从GDELT网站下载压缩CSV并转换为DataFrame的问题求助
解决GDELT压缩CSV文件读取并转换为DataFrame的问题
你的代码目前存在两处关键问题需要修正,同时可以通过以下方案读取压缩包内的CSV文件并转为DataFrame:
1. 修正文件下载环节的问题
原代码未发起HTTP请求(resp变量未定义),且初始url是文件列表页面,并非目标文件的直接下载地址。需要构造正确的下载URL并完成请求:
import pandas as pd import zipfile import requests from datetime import date, timedelta # 构造目标文件的直接下载路径 base_file_url = 'http://data.gdeltproject.org/events/' yesterday = (date.today() - timedelta(days=1)).strftime('%Y%m%d') target_file = yesterday + '.export.CSV.zip' full_download_url = base_file_url + target_file # 发起下载请求并检查请求状态 resp = requests.get(full_download_url) resp.raise_for_status() # 请求失败时直接抛出异常 # 保存文件到本地 with open(target_file, "wb") as f: f.write(resp.content)
2. 读取压缩文件并转为DataFrame
无需使用readlines,可以直接通过zipfile操作压缩包,结合pandas.read_csv完成格式转换:
# 方式1:读取本地已保存的压缩文件 with zipfile.ZipFile(target_file, 'r') as zip_obj: # 压缩包内仅包含一个CSV文件,取第一个文件名 inner_csv_name = zip_obj.namelist()[0] # GDELT的CSV以制表符分隔,需指定分隔符 df = pd.read_csv(zip_obj.open(inner_csv_name), sep='\t', low_memory=False) # 方式2:直接从内存读取,不保存本地(更高效) import io # 需要新增该导入 with zipfile.ZipFile(io.BytesIO(resp.content), 'r') as zip_obj: inner_csv_name = zip_obj.namelist()[0] df = pd.read_csv(zip_obj.open(inner_csv_name), sep='\t', low_memory=False)
关键提示
- GDELT事件文件采用**制表符(\t)**作为分隔符,必须在
read_csv中指定sep='\t'才能正确解析。 - 文件数据量大、列数多,添加
low_memory=False可避免类型推断引发的警告。
内容的提问来源于stack exchange,提问作者frank
相关产品推荐
相关产品推荐

