pandas如何读取DataFrame指定中间区间的行数据
Pandas读取大体积CSV时加载指定行范围的方法
当你需要从包含1000万条记录的CSV中,仅加载第200万到300万行的记录时,可以组合使用pandas read_csv方法的skiprows和nrows参数实现,具体方案如下:
skiprows:设置为要跳过的开头行数,这里要从第200万行开始读取,所以赋值为2000000nrows:设置为本次需要加载的总记录数,200万到300万行之间共100万条记录,所以赋值为1000000
示例代码:
start_point = 2000000 number_of_records = 1000000 # 200万~300万行共计100万条记录 df = pd.read_csv(file, skiprows=start_point, nrows=number_of_records)
补充说明:如果你的CSV文件第一行是表头,且需要保留表头作为DataFrame的列名,可以将
skiprows参数修改为range(1, start_point),这样只会跳过第1行到第200万行的内容,保留第0行的表头信息。
内容的提问来源于stack exchange,提问作者Chris_007
相关产品推荐
相关产品推荐

