使用Dedupe库做记录链接遇OverflowError,求列过滤方案
解决Dedupe库的OverflowError:过滤不必要的列
这个OverflowError: Python int too large to convert to C ssize_t问题确实是因为数据维度太高(列太多)导致的——Dedupe底层依赖C扩展处理特征计算,当单条记录的特征数量过大时,就会触发这个整数溢出的问题。过滤掉无关的列,只保留用于记录匹配的核心特征,就能解决这个问题。
我给你修改下readData函数,让它支持指定要保留的列:
def readData(filename, keep_columns=None): """ Read in our data from a CSV file and create a dictionary of records, where the key is a unique record ID. Args: filename: 输入CSV文件路径 keep_columns: 需要保留的列名列表,比如['name', 'address', 'phone'],默认保留所有列 """ data_d = {} with codecs.open(filename,encoding='utf-8') as f: reader = csv.DictReader(f) # 如果指定了要保留的列,先确认这些列都在CSV里 if keep_columns is not None: missing_cols = [col for col in keep_columns if col not in reader.fieldnames] if missing_cols: raise ValueError(f"CSV文件中找不到这些列:{missing_cols}") for i, row in enumerate(reader): # 只保留指定的列,或者保留所有列 if keep_columns is not None: filtered_row = {k: row[k] for k in keep_columns} else: filtered_row = row.copy() clean_row = dict([(k, preProcess(v)) for (k, v) in filtered_row.items()]) data_d[filename + str(i)] = dict(clean_row) return data_d
使用示例
比如你的CSV里有id、name、email、address、create_time这些列,其中只有name、email、address是用于判断记录是否重复的核心特征,那调用的时候就可以这样:
# 只保留核心匹配列 data = readData("your_data.csv", keep_columns=['name', 'email', 'address'])
额外注意点
- 一定要确保
keep_columns里的列都是对记录匹配有帮助的特征,比如姓名、联系方式、地址这类,像自增ID、创建时间这类无关列完全可以去掉。 - 检查你的
preProcess函数,确保它只处理这些保留下来的列,避免做无用的预处理操作。
这样过滤后,每条记录的特征维度会大幅降低,Dedupe处理起来就不会触发溢出错误了。
内容的提问来源于stack exchange,提问作者Dr Sima
相关产品推荐
相关产品推荐

