You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

创建LightGBM Dataset及调用train API时,params参数可指定哪些内容?

LightGBM Dataset与train函数params参数详解

一、lightgbm.Dataset的params参数可指定内容

lightgbm.Dataset的params用于配置数据加载、预处理相关逻辑,官方文档虽未详细罗列,但其可指定的键主要包括:

  • max_bin: 特征的最大分箱数,控制直方图的精细度
  • min_data_in_bin: 每个分箱需包含的最小样本数,避免分箱过细导致过拟合
  • data_random_seed: 数据采样时的随机种子,保证数据处理过程可复现
  • is_unbalance: 布尔值,标记是否为不平衡分类数据集,启用后模型会自动调整样本权重
  • scale_pos_weight: 正样本的权重系数,用于二分类不平衡场景,平衡正负样本对损失的贡献
  • categorical_feature: 分类特征的列索引或名称列表,告知模型哪些特征是分类类型
  • ignore_column: 需要忽略的特征列索引或名称列表,加载数据时会跳过这些列
  • weight: 样本权重数组,用于赋予不同样本不同的重要性
  • group: 样本分组信息,适用于排序、推荐等需要按组处理的任务

二、lightgbm.train的params参数可指定内容

lightgbm.train的params是模型训练的核心配置,优先级高于单独传入的参数,完整可指定键列表按类别整理如下:

核心训练配置

  • boosting_type: 提升算法类型,可选值包括gbdt(梯度提升决策树)、dart(Dropouts meet Multiple Additive Regression Trees)、goss(Gradient-based One-Side Sampling)、rf(随机森林)
  • objective: 目标函数,常用值有binary(二分类)、multiclass(多分类,需配合num_class参数)、regression(回归)、regression_l1(L1回归)等
  • metric: 评估指标,可指定单个或多个,比如auc、logloss、mse、mae、accuracy等
  • num_leaves: 每棵树的最大叶子节点数,控制树的复杂度
  • learning_rate: 学习率,控制每轮迭代的步长,通常设置为0.01-0.1
  • n_estimators: 迭代次数(即树的数量)
  • max_depth: 树的最大深度,限制树的生长,防止过拟合(若不设置则由num_leaves控制)
  • min_child_samples: 叶子节点所需的最小样本数,样本不足时不会继续分裂节点

正则化配置

  • lambda_l1: L1正则化系数,用于约束模型权重,减少过拟合
  • lambda_l2: L2正则化系数,作用同L1,只是正则化方式不同
  • min_split_gain: 节点分裂所需的最小增益,只有当分裂带来的增益大于该值时才会进行分裂
  • feature_fraction: 每轮迭代随机选择的特征比例,用于特征采样,减少过拟合
  • bagging_fraction: 每轮迭代随机选择的样本比例,用于样本采样,减少过拟合
  • bagging_freq: 执行bagging的迭代间隔次数,比如设为5表示每5轮进行一次样本采样

不平衡数据集配置

  • is_unbalance: 布尔值,标记是否为不平衡分类数据集,启用后模型自动调整样本权重
  • scale_pos_weight: 正样本权重系数,用于二分类不平衡场景,平衡正负样本对损失的贡献

其他配置

  • random_state: 随机种子,保证训练过程的可复现性
  • verbose: 日志输出级别,0为静默模式,1为基本信息输出,2为详细日志输出

内容的提问来源于stack exchange,提问作者figs_and_nuts

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.27 05:55:18