如何基于四个预设列表对DataFrame的教育列快速分类以创建新列?
如何基于四个预设列表对DataFrame的教育列快速分类以创建新列?
嘿,这个场景我太懂了——手动一个个写映射确实要写到崩溃!尤其是当类别列表很长的时候,完全没必要重复劳动。这里有两个实用的方法,都能帮你快速搞定,而且完美匹配你想要的结果:
方法1:构建反向映射字典(最简洁高效)
我们可以先把你定义的四个列表转换成一个自动生成的映射字典,不用手动敲每个键值对,后续要新增教育项也只需要在对应列表里加就行:
import pandas as pd # 先定义你的四个分类列表 high_school = ['grade 9', 'grade 10', 'grade 11', 'grade 12'] undergrad = ['BS', 'B.Com', 'B.Ed', 'BA', 'LLB'] masters = ['MA', 'MBA', 'M.Ed', 'MPA', 'LLM', 'MTech', 'M.Tech'] doctorate = ['PhD', 'MD', 'DO'] # 自动生成映射字典 mapping_dict = {} # 把类别名称和对应的列表一一配对遍历 for level, items in zip( ['high school', 'undergrad', 'masters', 'doctorate'], [high_school, undergrad, masters, doctorate] ): for item in items: mapping_dict[item] = level # 生成新列,不在字典中的值会自动返回NaN df['level'] = df['education'].map(mapping_dict)
这样处理后,不在任何列表里的教育值(比如你的例子里的'5.47'、'John')会自动被设为NaN,完全符合你的预期结果。
方法2:用numpy.select实现多条件匹配(扩展性更强)
如果你以后可能需要加入更复杂的匹配规则(比如模糊匹配、包含特定关键词等),用np.select会更灵活,它能按顺序判断条件并返回对应值:
import pandas as pd import numpy as np # 先定义你的四个分类列表 high_school = ['grade 9', 'grade 10', 'grade 11', 'grade 12'] undergrad = ['BS', 'B.Com', 'B.Ed', 'BA', 'LLB'] masters = ['MA', 'MBA', 'M.Ed', 'MPA', 'LLM', 'MTech', 'M.Tech'] doctorate = ['PhD', 'MD', 'DO'] # 定义匹配条件和对应结果 conditions = [ df['education'].isin(high_school), df['education'].isin(undergrad), df['education'].isin(masters), df['education'].isin(doctorate) ] choices = ['high school', 'undergrad', 'masters', 'doctorate'] # 生成新列,default指定不满足任何条件时返回的值 df['level'] = np.select(conditions, choices, default=np.nan)
这个方法的优势是,要是以后遇到比如"Bachelor of Arts"这种长名称,你可以直接把条件改成df['education'].str.contains('Bachelor'),扩展性拉满。
两种方法都能完美替代你不想用的手动映射,选哪个取决于你后续是否需要调整匹配规则~
备注:内容来源于stack exchange,提问作者maximum_confusion
相关产品推荐
相关产品推荐

