如何高效统计唯一行总数并将结果保存到新列
唯一行计数简便实现方案
Excel/WPS 场景
- 全选所有需要判断唯一性的列,插入数据透视表
- 将所有用于判断唯一行的字段拖拽到「行」区域
- 任选一个字段拖拽到「值」区域,设置聚合规则为「计数」
- 透视表生成后自动输出所有唯一行的对应出现次数,14000行数据处理耗时不到1秒,无需手动枚举任何唯一值
Python 处理场景
用pandas内置的聚合方法即可快速实现,性能完全适配万级行规模的数据集:
import pandas as pd # 读取本地数据集,可根据你的文件格式替换为read_excel等方法 df = pd.read_csv("你的数据文件路径.csv") # 统计全列组合的唯一行出现次数 count_res = df.value_counts().reset_index(name="出现次数") # 如果仅需按指定列判断唯一行,可指定对应列名 # count_res = df.groupby(["列名1", "列名2"]).size().reset_index(name="出现次数")
生成的count_res可直接导出为csv或excel文件使用。
SQL 处理场景
如果数据存储在数据库中,直接通过GROUP BY聚合查询即可:
SELECT 列1, 列2, 列3, COUNT(*) AS 出现次数 FROM 你的业务表名 GROUP BY 列1, 列2, 列3
查询结果直接返回每类唯一行的计数结果。
内容的提问来源于stack exchange,提问作者Tahmeed
相关产品推荐
相关产品推荐

