You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Kaggle泰坦尼克数据集训练时样本数量不一致报错如何解决

报错原因

这个错误是Scikit-learn的输入校验逻辑触发的:要求训练用的特征矩阵和标签向量的样本数必须完全一致,你当前的tr_features有534条样本,tr_labels有535条样本,数量不匹配导致训练失败。

解决步骤
  • 第一步:先确认两者的样本数量差异,执行以下代码:
print("特征样本数:", tr_features.shape[0])
print("标签样本数:", tr_labels.shape[0])
  • 第二步:回溯特征处理流程,排查样本数不一致的根源:通常是在缺失值删除、特征编码、数据集拆分环节误删了部分特征样本,或者标签处理时多保留了无效样本。
  • 第三步:对齐两者的样本索引,直接用索引匹配保证数量一致:
# 以标签的索引为基准,过滤特征数据
tr_features = tr_features.loc[tr_labels.index]
# 校验对齐后的数量
assert tr_features.shape[0] == tr_labels.shape[0]
  • 第四步:对齐完成后,重新运行原逻辑回归网格搜索代码即可正常执行。

内容的提问来源于stack exchange,提问作者Victor

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.04 18:42:02