You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

处理银行数据集「当前工作年限」列整数提取问题求助

问题分析与解决办法

嘿,这个问题其实挺常见的,我一眼就瞅出问题所在啦!

你之所以得到的是函数地址而非整数,核心原因是你在apply的lambda里没有调用year_converter函数,而是直接返回了函数本身。咱们来看你的代码:

bank_data['Years in current job'] = bank_data['Years in current job'].apply(lambda x: year_converter)

这里的lambda x: year_converter相当于告诉Python:“把每个x对应的year_converter函数对象存进去”,而不是“用x作为参数调用year_converter,把返回的整数存进去”。所以结果自然是函数的内存地址啦。


两种修正方案

方案一:在lambda里调用函数并传入参数

把lambda改成调用year_converter(x),这样就会执行函数并返回整数:

import re

def year_converter(x): 
    return int(re.search(r'\d+', x).group())

bank_data['Years in current job'] = bank_data['Years in current job'].apply(lambda x: year_converter(x))

方案二:直接传入函数名(更简洁)

其实apply会自动把每个元素作为参数传给你指定的函数,所以完全不需要lambda,直接传year_converter就行:

import re

def year_converter(x): 
    return int(re.search(r'\d+', x).group())

bank_data['Years in current job'] = bank_data['Years in current job'].apply(year_converter)

额外建议:处理异常情况

如果你的数据集里存在没有数字的单元格(比如“Unknown”或者空值),re.search(r'\d+', x)会返回None,调用.group()就会报错。可以给函数加个异常处理,比如:

import re

def year_converter(x):
    match = re.search(r'\d+', str(x))  # 先转成字符串避免非字符串类型报错
    return int(match.group()) if match else None  # 没有匹配到就返回None

这样能避免程序崩溃,也能标记出那些无法提取数字的行。

内容的提问来源于stack exchange,提问作者Ashutosh Kumar

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.26 09:10:39