如何用Python批量判断DataFrame各列是否存在重复值
解决方案
- 先确保已安装并导入Pandas库,未安装可执行
pip install pandas完成安装。 - 构造或读取目标DataFrame(以下以你提供的示例数据为例):
import pandas as pd data = { 'Student': ['Joe', 'James', 'Bob', 'Joe', 'Jack', 'Jack'], 'Date': ['December 2017', 'January 2018', 'April 2018', 'December 2017', 'February 2018', 'March 2018'], 'flag': [4,5,6,8,9,1] } df = pd.DataFrame(data)
- 执行核心逻辑,遍历每一列判断是否存在重复值,并整理成指定格式:
# 对每一列检查是否存在重复值 dup_check = df.apply(lambda col: col.duplicated().any()) # 转换为目标格式的DataFrame result = dup_check.reset_index() result.columns = ['Column', 'Dup']
- 输出结果:
- 若要输出标准DataFrame格式,直接运行
print(result); - 若要输出和示例完全一致的纯文本格式,运行:
- 若要输出标准DataFrame格式,直接运行
print(result.to_string(index=False))
此时输出为:
Column Dup Student True Date True flag False
内容的提问来源于stack exchange,提问作者lydias
相关产品推荐
相关产品推荐

