You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从Pandas DataFrame中筛选column2出现频次大于2的对应行

问题原因

你的代码存在3个错误:

  • 统计维度错误:需求是统计column2的出现频次,你实际统计的是column1
  • 返回值错误:你返回的是频次统计的Series对象,不是原数据集的对应行
  • 变量名错误:你定义的变量是cmd_more_than_2,返回的是未定义的cmd_more_than_1

可行实现方案

你可以用以下两种方法实现需求:

方法1:使用groupby + transform 一步筛选

import pandas as pd

def get_cmd_more_than_2(dfb):
    # 对column2分组统计出现次数,返回和原数据长度一致的计数序列
    col2_count = dfb.groupby('column2')['column2'].transform('count')
    # 筛选出次数大于2的所有行,保留全部列
    return dfb[col2_count > 2]

dfb = get_cmd_more_than_2(dfb)

方法2:先取有效取值再过滤

import pandas as pd

def get_cmd_more_than_2(dfb):
    # 先拿到column2中出现次数大于2的所有取值
    valid_col2 = dfb['column2'].value_counts()[lambda x: x > 2].index
    # 过滤column2在有效取值范围内的行
    return dfb[dfb['column2'].isin(valid_col2)]

两种方法运行后得到的结果和你给出的预期输出完全一致:column2中xx共出现6次符合条件被保留,bb仅出现2次被过滤。


内容的提问来源于stack exchange,提问作者redplanet

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 07:27:04