You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何基于四个预设列表对DataFrame的教育列快速分类以创建新列?

如何基于四个预设列表对DataFrame的教育列快速分类以创建新列?

嘿,这个场景我太懂了——手动一个个写映射确实要写到崩溃!尤其是当类别列表很长的时候,完全没必要重复劳动。这里有两个实用的方法,都能帮你快速搞定,而且完美匹配你想要的结果:

方法1:构建反向映射字典(最简洁高效)

我们可以先把你定义的四个列表转换成一个自动生成的映射字典,不用手动敲每个键值对,后续要新增教育项也只需要在对应列表里加就行:

import pandas as pd

# 先定义你的四个分类列表
high_school = ['grade 9', 'grade 10', 'grade 11', 'grade 12']
undergrad = ['BS', 'B.Com', 'B.Ed', 'BA', 'LLB']
masters = ['MA', 'MBA', 'M.Ed', 'MPA', 'LLM', 'MTech', 'M.Tech']
doctorate = ['PhD', 'MD', 'DO']

# 自动生成映射字典
mapping_dict = {}
# 把类别名称和对应的列表一一配对遍历
for level, items in zip(
    ['high school', 'undergrad', 'masters', 'doctorate'],
    [high_school, undergrad, masters, doctorate]
):
    for item in items:
        mapping_dict[item] = level

# 生成新列,不在字典中的值会自动返回NaN
df['level'] = df['education'].map(mapping_dict)

这样处理后,不在任何列表里的教育值(比如你的例子里的'5.47'、'John')会自动被设为NaN,完全符合你的预期结果。

方法2:用numpy.select实现多条件匹配(扩展性更强)

如果你以后可能需要加入更复杂的匹配规则(比如模糊匹配、包含特定关键词等),用np.select会更灵活,它能按顺序判断条件并返回对应值:

import pandas as pd
import numpy as np

# 先定义你的四个分类列表
high_school = ['grade 9', 'grade 10', 'grade 11', 'grade 12']
undergrad = ['BS', 'B.Com', 'B.Ed', 'BA', 'LLB']
masters = ['MA', 'MBA', 'M.Ed', 'MPA', 'LLM', 'MTech', 'M.Tech']
doctorate = ['PhD', 'MD', 'DO']

# 定义匹配条件和对应结果
conditions = [
    df['education'].isin(high_school),
    df['education'].isin(undergrad),
    df['education'].isin(masters),
    df['education'].isin(doctorate)
]
choices = ['high school', 'undergrad', 'masters', 'doctorate']

# 生成新列,default指定不满足任何条件时返回的值
df['level'] = np.select(conditions, choices, default=np.nan)

这个方法的优势是,要是以后遇到比如"Bachelor of Arts"这种长名称,你可以直接把条件改成df['education'].str.contains('Bachelor'),扩展性拉满。

两种方法都能完美替代你不想用的手动映射,选哪个取决于你后续是否需要调整匹配规则~

备注:内容来源于stack exchange,提问作者maximum_confusion

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.13 19:58:06