You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

从GDELT网站下载压缩CSV并转换为DataFrame的问题求助

解决GDELT压缩CSV文件读取并转换为DataFrame的问题

你的代码目前存在两处关键问题需要修正,同时可以通过以下方案读取压缩包内的CSV文件并转为DataFrame:

1. 修正文件下载环节的问题

原代码未发起HTTP请求(resp变量未定义),且初始url是文件列表页面,并非目标文件的直接下载地址。需要构造正确的下载URL并完成请求:

import pandas as pd
import zipfile
import requests
from datetime import date, timedelta  

# 构造目标文件的直接下载路径
base_file_url = 'http://data.gdeltproject.org/events/'
yesterday = (date.today() - timedelta(days=1)).strftime('%Y%m%d')
target_file = yesterday + '.export.CSV.zip'
full_download_url = base_file_url + target_file

# 发起下载请求并检查请求状态
resp = requests.get(full_download_url)
resp.raise_for_status()  # 请求失败时直接抛出异常

# 保存文件到本地
with open(target_file, "wb") as f: 
    f.write(resp.content) 

2. 读取压缩文件并转为DataFrame

无需使用readlines,可以直接通过zipfile操作压缩包,结合pandas.read_csv完成格式转换:

# 方式1:读取本地已保存的压缩文件
with zipfile.ZipFile(target_file, 'r') as zip_obj:
    # 压缩包内仅包含一个CSV文件,取第一个文件名
    inner_csv_name = zip_obj.namelist()[0]
    # GDELT的CSV以制表符分隔,需指定分隔符
    df = pd.read_csv(zip_obj.open(inner_csv_name), sep='\t', low_memory=False)

# 方式2:直接从内存读取,不保存本地(更高效)
import io  # 需要新增该导入
with zipfile.ZipFile(io.BytesIO(resp.content), 'r') as zip_obj:
    inner_csv_name = zip_obj.namelist()[0]
    df = pd.read_csv(zip_obj.open(inner_csv_name), sep='\t', low_memory=False)

关键提示

  • GDELT事件文件采用**制表符(\t)**作为分隔符,必须在read_csv中指定sep='\t'才能正确解析。
  • 文件数据量大、列数多,添加low_memory=False可避免类型推断引发的警告。

内容的提问来源于stack exchange,提问作者frank

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.25 09:57:33