You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

超500万行CSV文件两列匹配校验及错误自动修正需求

超大规模CSV文件ID与船舶类型匹配修正方案

针对500万行的CSV数据,核心思路是先构建ID-船舶类型的正确映射关系,再批量校验替换错误值,以下是两种高效实现方式:

一、Python 代码实现(适合有技术基础的用户)

用pandas处理大文件效率极高,步骤如下:

  1. 分块读取大文件:避免一次性加载导致内存溢出
import pandas as pd

# 按每10万行分块读取CSV,可根据内存情况调整chunksize值
chunk_iter = pd.read_csv("你的文件路径.csv", chunksize=100000)
  1. 构建正确映射表:
    • 方法1:从现有数据中提取每个ID对应的最常见船舶类型(默认多数数据为正确值)
    full_df = pd.concat(chunk_iter)
    # 按ID分组,取出现次数最多的船舶类型作为对应ID的标准值
    mapping = full_df.groupby('ID列名')['船舶类型列名'].agg(lambda x: x.value_counts().index[0]).to_dict()
    
    • 方法2:如果有官方预设的ID-类型映射表,直接读取导入即可
  2. 批量修正并导出:
# 用映射表替换错误的船舶类型值
full_df['船舶类型列名'] = full_df['ID列名'].map(mapping)
# 导出修正后的文件
full_df.to_csv("修正后的文件.csv", index=False)

二、Power Query 可视化实现(适合办公场景用户)

无需编写复杂代码,依托Excel/Power BI内置工具即可完成:

  1. 导入CSV到Power Query:
    • Excel操作路径:数据>获取数据>从文件>从CSV,选择文件后进入Power Query编辑器
  2. 构建标准映射表:
    • 复制原数据表,对复制后的表按「ID列」分组,聚合方式选择「值计数」,保留每个ID对应的最高频船舶类型,整理成ID-类型的标准映射表
  3. 合并修正原表:
    • 返回原数据表,选择「合并查询」,将原表的ID列与映射表的ID列匹配,加载映射表中的标准船舶类型,替换原有的错误列
  4. 导出结果:关闭Power Query编辑器,将修正后的数据加载回Excel,或直接导出为CSV格式

注意事项

  • 处理前务必备份原始文件,防止数据丢失
  • 若文件存在特殊编码,读取时需指定对应编码(如encoding='utf-8'或gbk)
  • Python处理时,若内存仍不足可进一步调小chunksize参数

内容的提问来源于stack exchange,提问作者K_abdn

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.15 13:25:57