You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用TensorFlow时如何合并泰坦尼克号数据集的训练集和测试集

合并拆分后数据集的实现方法

你当前使用的是pandas加载的两个结构完全一致的DataFrame,直接使用pd.concat()按行拼接即可,替换你代码中问号部分的代码如下:

# 基础合并方案:自动重置行索引
MY_DATA = pd.concat([data_train, data_test], ignore_index=True)

参数说明&可选优化

  • ignore_index=True:合并后重置整个数据集的行索引,避免原训练集、验证集的索引重复导致后续数据处理报错,是同结构数据集合并的常用参数。
  • 如果你需要保留每行数据的原始拆分归属,可添加keys参数标记来源:
    # 带来源标记的合并方案,生成多级索引,第一级为原始数据集归属
    MY_DATA = pd.concat([data_train, data_test], keys=['train', 'eval'])
    

合并验证

你可以执行以下代码校验合并结果是否正确:

print(f"训练集样本量:{len(data_train)},验证集样本量:{len(data_test)},合并后总样本量:{len(MY_DATA)}")

正常输出为:训练集样本量:627,验证集样本量:264,合并后总样本量:891,和泰坦尼克号公开数据集的总样本量一致,说明合并无误。


内容的提问来源于stack exchange,提问作者GEBRU

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.04 04:24:03