You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何高效从大型pandas DataFrame选取数据构建DataFrame或字典

高效从大型DataFrame构建目标字典/DataFrame的方案

针对你需要从大型pandas DataFrame中选取数据,快速构建指定结构字典(或DataFrame)的需求,结合你给出的预期输出,我整理了几个实用且高效的实现思路,尽量避免低效的循环操作,利用pandas的矢量化特性提升性能:

假设的原始DataFrame结构

先明确一个常见的原始数据结构(如果你的结构不同,只需调整列名或分组逻辑即可):
假设你的DataFrame包含分组标识列group(对应0、1、2),以及每组对应的x、y数值列,示例结构如下:

groupx1x2y1y2
07.0986.079.069.0
017.06.0179.0169.0
07.067.0729.069.0
...............

方法一:利用groupby分组聚合(推荐大数据量场景)

groupby是pandas处理分组数据的高效工具,仅需一次分组操作就能批量提取各组数据,比多次重复筛选效率高很多:

import pandas as pd

# 假设你的原始DataFrame名为df
result_dict = {}

# 按group列分组,遍历每个分组
for group_id, group_data in df.groupby('group'):
    # 提取当前组的x列,转成嵌套列表存入xsN
    result_dict[f'xs{group_id}'] = group_data[['x1', 'x2']].values.tolist()
    # 提取当前组的y列,转成嵌套列表存入ysN
    result_dict[f'ys{group_id}'] = group_data[['y1', 'y2']].values.tolist()

方法二:按列前缀批量提取(适合列名规则化的场景)

如果你的原始DataFrame列名本身是规则化的(比如xs0_0、xs0_1、ys0_0、ys0_1),可以直接按列前缀批量处理:

N = 3  # 你指定的外层列表数量
result_dict = {}

# 处理所有xs开头的列组
for n in range(N):
    # 选取当前组的x列
    x_cols = [f'xs{n}_0', f'xs{n}_1']
    # 每行转成子列表,再组合成大列表
    result_dict[f'xs{n}'] = df[x_cols].values.tolist()

# 处理所有ys开头的列组
for n in range(N):
    y_cols = [f'ys{n}_0', f'ys{n}_1']
    result_dict[f'ys{n}'] = df[y_cols].values.tolist()

性能优化关键点

  • 避免逐行循环操作:尽量使用values.tolist()这种矢量化方法生成嵌套列表,不要手动遍历每行append,后者在大数据量下会严重拖慢速度。
  • 优先用groupby替代多次筛选:当需要按组提取数据时,groupby仅做一次分组计算,比多次用df[df['group'] == n]筛选效率高得多。
  • 减少中间变量:如果不需要保留中间处理的DataFrame片段,直接生成字典可以节省内存占用。

转成DataFrame(如果需要)

如果之后需要将生成的字典转为DataFrame,只需一行代码:

result_df = pd.DataFrame.from_dict(result_dict, orient='index').T

生成的DataFrame中,每个单元格对应一个子列表,和你的字典结构完全对应。

内容的提问来源于stack exchange,提问作者ChesuCR

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.25 08:36:11