如何使用Pandas DataFrame按条件修改Excel中的推文标注数据行
处理Excel标注数据的Python实现方案
依赖安装
首先安装需要用到的第三方库:pip install pandas openpyxl
实现代码
import pandas as pd # 1. 读取本地原始标注Excel文件,替换引号内的内容为你的实际文件路径 df = pd.read_excel("原始标注文件路径.xlsx") # 2. 定义需要清空的目标列 clear_cols = ["Sentiment", "Sadness", "Love", "Anger", "Joy", "Fear"] # 3. 筛选所有NonEnglish为1的非英文推文行,将对应目标列设为空值 df.loc[df["NonEnglish"] == 1, clear_cols] = pd.NA # 4. 导出处理后的数据到新Excel文件,避免覆盖原始数据 # na_rep参数指定空值在Excel中显示为空白单元格 df.to_excel("处理后标注文件.xlsx", index=False, na_rep="")
注意事项
- 运行代码前请先备份原始标注数据,避免误操作导致数据丢失
- 如果你的文件是.xls格式,读取时需要额外指定引擎参数:
pd.read_excel("原始文件路径.xls", engine="xlrd"),同时需要提前安装xlrd库:pip install xlrd==1.2.0 - 代码默认会保留除目标列外的其他所有列数据不变,不会影响已标注的英文推文内容
内容的提问来源于stack exchange,提问作者Dionisius Pratama
相关产品推荐
相关产品推荐

