在ADF数据映射流中能否实现行引用?数据集转换需求咨询
批量拆分数据集的部门列提取与清洗方案
方法一:Excel手动处理
- 填充部门列:选中
department列所有空白单元格,按Ctrl+G打开定位窗口选择「空值」,输入=上方单元格的地址(比如选中B2空值时输入=B1),按Ctrl+Enter就能批量把上方的部门名称填充到所有对应空白行。 - 筛选有效数据:选中表头行,点击「数据」栏的「筛选」,在
employee code列的筛选菜单里取消勾选「空白」,只保留有员工编号的行。 - 清理多余行:筛选后选中底部的空白/无效行右键删除,最后取消筛选,只保留
department「employee code」「salary」三列即可。
方法二:Python(Pandas)自动化处理
如果数据量较大,用代码批量处理更高效:
import pandas as pd # 读取原始数据,根据实际文件格式调整(比如csv就用read_csv) df = pd.read_excel("原始数据.xlsx") # 用前一行的部门值填充当前行的空值,批量补全department列 df["department"] = df["department"].ffill() # 过滤掉员工编号为空的行(去掉部门标题行和底部多余行) df_cleaned = df[df["employee code"].notna()] # 只保留需要的三列 df_final = df_cleaned[["department", "employee code", "salary"]] # 导出清洗好的数据到新文件 df_final.to_excel("清洗后数据.xlsx", index=False)
内容的提问来源于stack exchange,提问作者Candice
相关产品推荐
相关产品推荐

