You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言层级数据扁平化:DataFrame区域关系展开技术问询

解决DataFrame层级区域扁平化的问题

这个需求用pandas处理超简单,核心就是利用区域行没有Areacode这个特征来标记区域,再用向下填充把区域名称传递给下属的地区,最后过滤掉不需要的区域行就行。我给你一步步拆解:

1. 先构造示例数据(方便测试)

首先我们把你给出的示例数据转换成pandas DataFrame:

import pandas as pd
import numpy as np

data = {
    'Area': ['Region1', 'Area1', 'Area2', 'Area3', 'Region2', 'Area1', 'Area4'],
    'Areacode': [np.nan, 1, 2, 3, np.nan, 1, 4],
    'Value': [23, 2, 1, 20, 14, 10, 4]
}
df = pd.DataFrame(data)

2. 生成Region列并向下填充

我们先识别出所有区域行(Areacode为NA的行),把这些行的Area值作为对应的区域名称,然后用ffill()(向前填充)方法,让每个下属地区继承它上方最近的区域名称:

# 提取区域行的Area值作为Region,然后向下填充
df['Region'] = df.loc[df['Areacode'].isna(), 'Area'].ffill()

3. 过滤掉原始的区域行

现在我们只需要保留有Areacode的行(也就是具体的地区行),同时重置索引让结果更整洁:

# 过滤掉无Areacode的区域行,重置索引
result_df = df[df['Areacode'].notna()].reset_index(drop=True)

4. 调整列顺序匹配需求

最后把列调整成你需要的顺序:

# 调整列顺序为Area → Areacode → Region → Value
result_df = result_df[['Area', 'Areacode', 'Region', 'Value']]

最终结果

运行完上面的代码后,result_df就是你想要的结构:

AreaAreacodeRegionValue
Area11.0Region12
Area22.0Region11
Area33.0Region120
Area11.0Region210
Area44.0Region24

如果你的Areacode需要是整数类型,只需要用result_df['Areacode'] = result_df['Areacode'].astype(int)转成整数就行,完全不影响结果。

内容的提问来源于stack exchange,提问作者ds_user

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.25 07:58:16