You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在不复制数据时统计Pandas中整数频率并排除NaN

解决方案

直接通过链式操作在原堆叠结果上完成过滤,不需要复制数据到新表:

情况1:仅统计严格int类型的数值(排除5.0这类浮点数形式的整数)

print(df.stack().dropna().loc[lambda s: s.apply(lambda val: isinstance(val, int))].value_counts())

情况2:统计值为整数的数值(包含5.0这类浮点数形式的整数)

如果数据里存在以浮点数存储的整数,可通过数值判断过滤:

print(df.stack().dropna().loc[lambda s: s.eq(s.astype(int))].value_counts())

代码说明

  • df.stack():将DataFrame按行堆叠为Series,保留原层级索引
  • .dropna():直接移除所有NaN值,属于链式操作,无需复制数据
  • .loc[lambda s: ...]:通过lambda表达式过滤符合条件的元素,避免生成中间表
  • .value_counts():最后统计各值的出现频率,默认会排除NaN(提前用dropna过滤属于双重保障)

之前尝试失败的原因

你用df["path"].value_counts()的思路不匹配当前场景:df.stack()是对整个DataFrame的堆叠操作,和单列df["path"]的操作对象完全不同;另外value_counts()本身默认dropna=True,但你需要额外过滤整数类型,单纯调整参数无法满足需求。

内容的提问来源于stack exchange,提问作者LoneWalkerNS

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.05 01:20:46