使用TensorFlow时如何合并泰坦尼克号数据集的训练集和测试集
合并拆分后数据集的实现方法
你当前使用的是pandas加载的两个结构完全一致的DataFrame,直接使用pd.concat()按行拼接即可,替换你代码中问号部分的代码如下:
# 基础合并方案:自动重置行索引 MY_DATA = pd.concat([data_train, data_test], ignore_index=True)
参数说明&可选优化
ignore_index=True:合并后重置整个数据集的行索引,避免原训练集、验证集的索引重复导致后续数据处理报错,是同结构数据集合并的常用参数。- 如果你需要保留每行数据的原始拆分归属,可添加
keys参数标记来源:# 带来源标记的合并方案,生成多级索引,第一级为原始数据集归属 MY_DATA = pd.concat([data_train, data_test], keys=['train', 'eval'])
合并验证
你可以执行以下代码校验合并结果是否正确:
print(f"训练集样本量:{len(data_train)},验证集样本量:{len(data_test)},合并后总样本量:{len(MY_DATA)}")
正常输出为:训练集样本量:627,验证集样本量:264,合并后总样本量:891,和泰坦尼克号公开数据集的总样本量一致,说明合并无误。
内容的提问来源于stack exchange,提问作者GEBRU
相关产品推荐
相关产品推荐

