Python中如何按CSAT列取值将数据集划分为训练集与测试集
Python 数据集拆分实现
依赖准备
先确保安装pandas数据处理库,未安装可执行以下命令:pip install pandas
完整代码
import pandas as pd # 读取数据集,可根据你的文件格式替换为read_excel等对应方法 df = pd.read_csv("你的数据集文件路径") # 可选:提前删除CSAT列为空的行,避免拆分异常 df = df.dropna(subset=['CSAT']) # 按规则拆分训练集和测试集 train_set = df[df['CSAT'] != 0].reset_index(drop=True) test_set = df[df['CSAT'] == 0].reset_index(drop=True) # 输出拆分结果校验 print(f"训练集数据量:{train_set.shape[0]} 行") print(f"测试集数据量:{test_set.shape[0]} 行")
样例拆分结果
对应你给出的10行样例数据集,拆分后:
- 训练集共5行,全部为CSAT取值非0的数据
- 测试集共5行,全部为CSAT取值为0的数据
内容的提问来源于stack exchange,提问作者Saud Ansari
相关产品推荐
相关产品推荐

