运行Pandas日期编码函数时触发ValueError:传入项数与预期不符的问题排查
问题排查与解决方案
首先,咱们来拆解你遇到的ValueError问题——核心原因是你试图把整个DataFrame赋值给单个列,这就好比想把一整箱书塞进一个抽屉格子里,维度完全不匹配。
错误根源分析
看你的encoding函数里这两行:
df['feature_week_day'] = encoding_1(df,'Week Day',7) df['feature_month'] = encoding_1(df,'Month', 12)
而你的encoding_1函数是这样的:它接收df后,直接在原df上添加sine_xxx和cosine_xxx两列,然后返回整个df。当你把这个返回的df(包含多列)赋值给df['feature_week_day']这个单列时,pandas就会报错,因为它预期接收1维数据,结果收到了整个DataFrame的多列数据。
另外,你的Date列里有20210419这种无分隔符的日期格式,虽然pd.to_datetime能自动识别,但最好统一处理,避免潜在的解析问题。
修正方案
我们需要调整encoding_1的逻辑,或者修改encoding里的调用方式,让它们的操作匹配。这里提供两种简洁的修正思路:
方案1:让encoding_1直接在原df上修改,无需赋值
既然encoding_1已经在输入的df上添加了新列,那我们不需要把它的返回值赋值给任何列,直接调用函数即可。修改后的代码如下:
import pandas as pd import numpy as np def encoding(df, column_name: str): if column_name in df.columns: # 统一处理日期格式,兼容分隔符/无分隔符的日期 dr = pd.to_datetime(df[column_name], format='mixed') df['Week Day'] = dr.weekday df['Month'] = dr.month # 直接调用encoding_1,它会在原df上添加sine和cosine列,无需赋值 encoding_1(df,'Week Day',7) encoding_1(df,'Month', 12) return df def encoding_1(df, column_name: str, period: int): if column_name in df.columns: df['sine_' + column_name] = np.sin(2 * np.pi * df[column_name] / period) df['cosine_' + column_name] = np.cos(2 * np.pi * df[column_name] / period) # 不需要返回df,因为已经修改了原df;若要返回也可以,但调用时不要赋值给单列 # 测试调用 df = pd.DataFrame({'Id':['ABC123', 'ABC124', 'ABC125', 'ABC126'], 'Date':['2008-01-01','2008-01-02','2020-02-01', '20210419']}) result = encoding(df,'Date') print(result.columns) # 输出会包含:Id, Date, Week Day, Month, sine_Week Day, cosine_Week Day, sine_Month, cosine_Month
方案2:让encoding_1返回生成的特征列,再合并到原df
如果你希望encoding_1更独立,不修改原df,可以让它返回生成的sine和cosine列,然后在encoding里合并到原df:
import pandas as pd import numpy as np def encoding(df, column_name: str): if column_name in df.columns: dr = pd.to_datetime(df[column_name], format='mixed') df['Week Day'] = dr.weekday df['Month'] = dr.month # 获取week day的编码特征,合并到df week_features = encoding_1(df,'Week Day',7) df = pd.concat([df, week_features], axis=1) # 获取month的编码特征,合并到df month_features = encoding_1(df,'Month', 12) df = pd.concat([df, month_features], axis=1) return df def encoding_1(df, column_name: str, period: int): if column_name in df.columns: # 生成特征列,不修改原df sine_col = np.sin(2 * np.pi * df[column_name] / period) cosine_col = np.cos(2 * np.pi * df[column_name] / period) # 返回新的DataFrame包含这两列 return pd.DataFrame({ 'sine_' + column_name: sine_col, 'cosine_' + column_name: cosine_col }) # 测试调用 df = pd.DataFrame({'Id':['ABC123', 'ABC124', 'ABC125', 'ABC126'], 'Date':['2008-01-01','2008-01-02','2020-02-01', '20210419']}) result = encoding(df,'Date') print(result)
额外优化点
- 使用
pd.to_datetime(..., format='mixed')可以更好地处理多种日期格式,比如你的20210419和2008-01-01混合的情况。 - 如果不想修改原始输入的df,可以在
encoding函数里先复制一份:df_copy = df.copy(),然后对df_copy进行操作,避免污染原数据。
内容的提问来源于stack exchange,提问作者user3447653
相关产品推荐
相关产品推荐

