如何将拆分后的X_train、X_test、y_train、y_test合并并保存为CSV
还原并保存拆分后的数据集
要把拆分后的训练/测试集还原成原数据集的结构并保存为CSV,按以下步骤操作:
提取原特征列名
直接从初始的df中获取特征列名,保证列名和顺序与原数据一致:feature_cols = df.drop(['label'], axis=1).columns还原训练集与测试集的DataFrame结构
将特征数组和标签数组合并,还原成和原df完全匹配的列结构:import pandas as pd # 还原训练集 train_df = pd.DataFrame(X_train, columns=feature_cols) train_df['label'] = y_train # 还原测试集 test_df = pd.DataFrame(X_test, columns=feature_cols) test_df['label'] = y_test保存为CSV文件
使用to_csv方法保存,设置index=False避免生成额外的索引列:# 保存训练集 train_df.to_csv('train_dataset.csv', index=False) # 保存测试集 test_df.to_csv('test_dataset.csv', index=False)
如果需要将训练集和测试集合并为一个完整数据集(注:拆分时的随机打乱会导致顺序与原数据集不同,但列结构完全一致),可以执行:
full_df = pd.concat([train_df, test_df], ignore_index=True) full_df.to_csv('full_dataset.csv', index=False)
内容的提问来源于stack exchange,提问作者Why-K
相关产品推荐
相关产品推荐

