pandas如何从含空值的下划线分隔列生成取首尾值的新列
错误原因
- 错误1:
Series.str.split()返回的是每个元素为列表的Series,直接写[0]是取整个Series的第0行元素,而非每个列表的第0位元素。你需要用.str[0](等价于.str.get(0))来提取每个列表的指定位置元素,同理取最后一位用.str[-1]即可,无需硬编码索引3,可适配不同长度的分割结果。 - 错误2:Python中
and是逻辑运算符,不是字符串拼接符,你的写法不会返回拼接后的字符串,只会返回逻辑运算的最终值,字符串拼接需要用+运算符。
正确实现代码
# 写法1:兼容空值,自动跳过空值处理 dfNC['collapsedntdom'] = np.where( dfNC[ntdom].isnull(), dfNC[ntdom], dfNC[ntdom].str.split('_').str[0] + "_" + dfNC[ntdom].str.split('_').str[-1] ) # 更高效的写法:只做一次分割,避免重复计算 split_series = dfNC[ntdom].str.split('_') dfNC['collapsedntdom'] = np.where( dfNC[ntdom].isnull(), dfNC[ntdom], split_series.str[0] + "_" + split_series.str[-1] )
内容的提问来源于stack exchange,提问作者SModi
相关产品推荐
相关产品推荐

