如何在R语言中基于country列创建聚合的子区域新列?
基于国家列生成子区域分类列的实现方案
假设你用Python的Pandas处理数据集,以下是具体实现步骤:
定义国家-子区域映射字典
先把每个国家对应的子区域整理成字典结构,示例如下:region_mapping = { "中国": "东亚", "日本": "东亚", "韩国": "东亚", "印度": "南亚", "巴基斯坦": "南亚", "巴西": "南美", "阿根廷": "南美", "美国": "北美", "加拿大": "北美" # 根据你的实际数据集补充完整所有国家的映射关系 }加载数据集并生成新列
用Pandas读取数据集后,通过map()方法将country列映射为新的sub_region列:import pandas as pd # 加载你的数据集(以CSV为例) df = pd.read_csv("your_dataset.csv") # 生成子区域分类列 df["sub_region"] = df["country"].map(region_mapping)处理未匹配的国家
若存在不在映射字典中的国家,可通过fillna()设置默认分类:df["sub_region"] = df["country"].map(region_mapping).fillna("其他区域")验证结果
查看处理后的核心列,确认是否符合预期:print(df[["country", "sub_region"]].head())
按上述步骤操作后,即可将原始数据中的国家列聚合分类为示例图(ideal.png)所示的子区域列。
内容的提问来源于stack exchange,提问作者Costa Wesele
相关产品推荐
相关产品推荐

