You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在R语言中拆分customerduration_data数据框为训练集与测试集

嘿,我来帮你搞定训练集和测试集拆分的问题!针对你的customerduration_data数据框,这里有几种实用的实现方法,你可以根据自己的需求来选:

方法1:基础R原生实现(无需额外安装包)

如果你不想装新包,用基础R的sample()函数就能快速搞定,记得先设置随机种子保证结果可重复:

# 设置随机种子,确保每次运行拆分结果一致
set.seed(123)

# 生成随机索引,比如按7:3的比例拆分训练集和测试集
train_index <- sample(nrow(customerduration_data), size = 0.7 * nrow(customerduration_data))

# 拆分数据
train_data <- customerduration_data[train_index, ]
test_data <- customerduration_data[-train_index, ]

这个方法简单直接,适合快速拆分;但如果需要分层抽样(比如保持durationCUST_hours的分布),下面的方法会更合适。

方法2:用caret包(经典机器学习工具包)

caret包的createDataPartition()函数可以方便地做分层抽样,特别适合需要维持目标变量分布的场景:

# 先安装并加载caret包(如果没装过的话)
# install.packages("caret")
library(caret)

set.seed(123)
# 按目标变量durationCUST_hours分层,70%作为训练集
train_index <- createDataPartition(customerduration_data$durationCUST_hours, p = 0.7, list = FALSE)

train_data <- customerduration_data[train_index, ]
test_data <- customerduration_data[-train_index, ]

这里的list = FALSE是让结果返回矩阵格式,方便直接用来索引数据框。

方法3:用rsample包(tidyverse生态友好工具)

因为你的数据是tbl_df(tidyverse风格的数据框),rsample包的语法会更贴合tidyverse的使用习惯,用起来很顺手:

# 安装并加载rsample包
# install.packages("rsample")
library(rsample)

set.seed(123)
# 初始化拆分,比例7:3
data_split <- initial_split(customerduration_data, prop = 0.7)

# 提取训练集和测试集
train_data <- training(data_split)
test_data <- testing(data_split)

这个方法会返回和原数据一致的tbl_df格式,后续用tidyverse的其他工具处理也更顺畅。

最后提醒下:不管用哪种方法,设置set.seed()都很重要——这样你每次运行代码得到的拆分结果都是一样的,方便后续的模型调试和验证~

内容的提问来源于stack exchange,提问作者Fleur Lolkema

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.26 10:38:03