如何从datacompy对比结果中提取不匹配列名?
使用datacompy提取DataFrame不匹配列名
我正在使用datacompy对比两个DataFrame的所有列,以
inventory_id作为连接列,目标是提取存在不匹配值的列名。示例中存在不匹配的列为indinv_vari_ware_uid,但实际场景中常出现多列不匹配的情况。希望通过编程方式从对比结果中提取这些列名,输出到文本文件或日志,避免阅读大量对比报告。现有代码如下:import datacompy compare = datacompy.Compare(df1, df2, join_columns=['inventory_id'], df1_name='df1', df2_name='df2') print(compare.report())
解决方案
datacompy的Compare对象内置了直接获取不匹配列的属性,无需手动解析冗长的报告文本。
提取不匹配列名
通过compare.mismatch_columns属性可直接获取所有存在值不匹配的列名列表:
import datacompy # 执行DataFrame对比 compare = datacompy.Compare( df1, df2, join_columns=['inventory_id'], df1_name='df1', df2_name='df2' ) # 获取所有值不匹配的列名 mismatched_cols = compare.mismatch_columns print("存在不匹配值的列名:", mismatched_cols)
输出到文本文件或日志
将结果保存到文本文件:
with open('mismatched_columns.txt', 'w', encoding='utf-8') as f: f.write("存在不匹配值的列名:\n") for col in mismatched_cols: f.write(f"- {col}\n")
写入日志(以Python标准logging模块为例):
import logging logging.basicConfig(filename='data_compare.log', level=logging.INFO, encoding='utf-8') logging.info(f"存在不匹配值的列名:{mismatched_cols}")
补充说明
compare.mismatch_columns返回的是对应行值存在差异的列;- 若要提取仅在某一张表中存在的列,可使用
compare.df1_unq_columns(仅df1包含)和compare.df2_unq_columns(仅df2包含); - 如需查看具体的不匹配行数据,可调用
compare.mismatches获取对应的DataFrame。
内容的提问来源于stack exchange,提问作者user032020
相关产品推荐
相关产品推荐

