You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

将对象列表组成的字典转换为Pandas DataFrame的方法

问题描述

我有一个以「字典-列表-对象-属性」层级存储的数据,具体结构如下:

data_dict = {
    '0': [TestObject(), TestObject(), TestObject(), TestObject(), TestObject()],
    '1': [TestObject(), TestObject(), TestObject(), TestObject(), TestObject()],
    '2': [TestObject(), TestObject(), TestObject(), TestObject(), TestObject()],
    '3': [TestObject(), TestObject(), TestObject(), TestObject(), TestObject()]
}

其中TestObject类定义为:

import random

class TestObject:
    def __init__(self):
        self.id = random.randint(1, 100)  # 补充randint参数避免运行报错
        self.date = random.randint(20200101, 20241231)
        self.size = random.randint(100, 1000)

我希望将其转换为指定格式的Pandas DataFrame,该格式需包含key(字典的键)、对象标识(列表中对象的索引)及对象的id、date、size属性。已知pandas.DataFrame.from_dict()方法,但需要提取列表中对象的属性来生成目标结构,请问该如何实现?

解决方案

可以通过遍历字典的键和对应列表中的对象,提取所需属性并整理成结构化数据,再转换为DataFrame。以下是两种可行的实现方式:

方法一:嵌套遍历构建数据行

直接遍历字典的每个键,再遍历对应列表中的每个对象,将每个对象的信息整理为字典,最后生成DataFrame:

import pandas as pd
import random

class TestObject:
    def __init__(self):
        self.id = random.randint(1, 100)
        self.date = random.randint(20200101, 20241231)
        self.size = random.randint(100, 1000)

# 初始化数据字典
data_dict = {
    '0': [TestObject() for _ in range(5)],
    '1': [TestObject() for _ in range(5)],
    '2': [TestObject() for _ in range(5)],
    '3': [TestObject() for _ in range(5)]
}

# 构建结构化数据列表
rows = []
for key, obj_list in data_dict.items():
    for idx, obj in enumerate(obj_list):
        rows.append({
            'key': key,
            '对象标识': idx,
            'id': obj.id,
            'date': obj.date,
            'size': obj.size
        })

# 转换为DataFrame
df = pd.DataFrame(rows)
print(df.head())

方法二:列表推导式简化代码

用列表推导式替代嵌套循环,代码更简洁:

import pandas as pd
import random

class TestObject:
    def __init__(self):
        self.id = random.randint(1, 100)
        self.date = random.randint(20200101, 20241231)
        self.size = random.randint(100, 1000)

data_dict = {
    '0': [TestObject() for _ in range(5)],
    '1': [TestObject() for _ in range(5)],
    '2': [TestObject() for _ in range(5)],
    '3': [TestObject() for _ in range(5)]
}

# 列表推导式生成数据行
rows = [
    {
        'key': key,
        '对象标识': idx,
        'id': obj.id,
        'date': obj.date,
        'size': obj.size
    }
    for key, obj_list in data_dict.items()
    for idx, obj in enumerate(obj_list)
]

df = pd.DataFrame(rows)
print(df.head())

核心说明

  • 两种方法逻辑一致:遍历字典的每个键(key),再遍历对应列表中的对象,用enumerate获取对象在列表中的索引作为对象标识,同时提取对象的三个属性。
  • 原random.randint()调用缺少参数,已补充合理范围避免运行报错。
  • 最终生成的DataFrame每行对应一个TestObject实例,完全匹配需求的字段结构。

内容的提问来源于stack exchange,提问作者user19678327

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 16:01:01