You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas DataFrame中筛选含指定职位名的行?

筛选包含指定职位的DataFrame行(基于列表型列)

假设你的Pandas DataFrame里有一列是列表类型(比如job_nm列每个元素都是职位名的列表),要筛选出该列表中包含目标职位的所有行,给你几个实用的实现方式:

方法一:用apply直接判断(最直观)

先搞个示例数据方便演示:

import pandas as pd

# 构造示例DataFrame
data = {
    'id': [1, 2, 3, 4],
    'name': ['张三', '李四', '王五', '赵六'],
    'job_nm': [['产品经理', '运营'], ['开发工程师'], ['测试工程师', '运维'], ['运营', 'UI设计']]
}
df = pd.DataFrame(data)

指定你要找的目标职位,比如target_job = '运营',然后执行筛选:

# 筛选job_nm列表中包含目标职位的行
filtered_df = df[df['job_nm'].apply(lambda x: target_job in x)]

原理很简单:apply会遍历job_nm列的每一个列表,用lambda表达式判断目标职位是否在列表里,返回的布尔序列会用来索引原DataFrame,直接得到符合条件的行。

方法二:用explode拆分后筛选(适合需要验证场景)

如果想先确认每个职位对应的行,或者需要更灵活的操作,可以先把列表拆成单独行,再筛选去重:

# 把job_nm列的列表拆成单独行
exploded_df = df.explode('job_nm')
# 筛选出目标职位的行,再根据id去重,最后合并回原数据结构
filtered_df = exploded_df[exploded_df['job_nm'] == target_job].drop_duplicates('id').merge(df, on=['id', 'name', 'job_nm'])

这种方式适合你需要先查看所有包含目标职位的明细行,再还原回原数据行结构的场景。

方法三:用numpy.vectorize优化性能(大数据量适用)

如果你的DataFrame数据量很大,apply的效率可能跟不上,用numpy的向量化操作来提速:

import numpy as np

# 定义判断函数
def has_target_job(job_list, target):
    return target in job_list

# 转换成向量化函数
vectorized_check = np.vectorize(has_target_job)
# 执行筛选
filtered_df = df[vectorized_check(df['job_nm'], target_job)]

向量化操作比apply的循环遍历效率高很多,数据量越大优势越明显。

额外注意

如果job_nm列存在空列表或者NaN值,记得先处理掉,避免报错:

# 过滤掉空列表和NaN的行
df = df[df['job_nm'].notna() & df['job_nm'].apply(lambda x: len(x) > 0)]

内容的提问来源于stack exchange,提问作者naman

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.18 14:02:34