Python中如何获取DataFrame过滤值并提取指定列符合重复次数要求的取值
实现方法
你已经得到了对应类别是否满足出现次数大于n的布尔序列,只需要用这个布尔序列过滤原计数Series的索引,再转成set即可,完整代码如下:
n = 5 # 统计type列每个取值的出现次数 type_counts = dataf["type"].value_counts() # 筛选出出现次数大于n的取值,直接转为set target_set = set(type_counts[type_counts > n].index)
代码说明
dataf["type"].value_counts()返回的是索引为type列的取值、值为对应出现次数的Series结构type_counts > n会生成布尔掩码,用来筛选出所有出现次数符合要求的行- 取筛选后结果的
index就能拿到Bike、Truck这类你需要的取值,外层套set()即可直接转为集合格式
如果你需要获取type列的所有去重取值(不管出现次数),可以直接用如下代码:
all_type_set = set(dataf["type"].unique())
内容的提问来源于stack exchange,提问作者jimmy
相关产品推荐
相关产品推荐

