如何编写Python脚本提取两个单列Excel文件的差异值并导出
提取Excel1中独有的内容并生成新文件
第一步:修正文件读取代码
你现有的读取代码缺少文件名的字符串引号,先修正:
import pandas as pd # 读取两个Excel文件,文件名需用引号包裹 df1 = pd.read_excel("Excel1.xlsx") df2 = pd.read_excel("Excel2.xlsx")
第二步:处理数据并筛选差异
由于你的示例中存在字符串带空格的情况(比如"Bob " vs "Bob"),需要先统一格式再筛选:
# 获取列名(假设Excel只有1列,取第一列的列名) column_name = df1.columns[0] # 去除字符串两端的空格,避免格式差异导致匹配失败 df1[column_name] = df1[column_name].str.strip() df2[column_name] = df2[column_name].str.strip() # 筛选df1中不存在于df2的内容 unique_to_df1 = df1[~df1[column_name].isin(df2[column_name])]
第三步:保存结果到新Excel文件
# 保存时关闭行索引,让输出文件更整洁 unique_to_df1.to_excel("Excel独有的内容.xlsx", index=False)
关键代码解释
str.strip():清除字符串前后的空格/换行符,解决因格式不一致导致的匹配错误~df1[column_name].isin(df2[column_name]):isin()判断内容是否存在于df2中,~符号取反,保留仅在df1中出现的行index=False:避免保存文件时自动生成额外的行索引列
内容的提问来源于stack exchange,提问作者Azhirius
相关产品推荐
相关产品推荐

