You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

疾病症状预测应用开发:数据集求助与Sklearn模型选型建议

症状预测疾病应用的数据集与模型建议

数据集相关

  • 可以优先考虑公开的医疗类数据集,比如UCI机器学习库中的Heart Disease Dataset、Pima Indians Diabetes Dataset,还有专门针对症状-疾病映射的Symptom-Disease Prediction Dataset,这些数据集都包含结构化的症状特征与疾病标签,适配你的任务场景。

Sklearn模型建议(针对当前的Decision Tree Classifier)

现有模型优化

Decision Tree的核心优势是解释性极强,能直观展示特征对预测结果的影响,但天生容易出现过拟合问题,建议用Sklearn的GridSearchCV做参数调优:

from sklearn.model_selection import GridSearchCV
from sklearn.tree import DecisionTreeClassifier

param_grid = {
    'max_depth': [3, 5, 7, None],
    'min_samples_split': [2, 5, 10],
    'min_samples_leaf': [1, 2, 4]
}
grid_search = GridSearchCV(DecisionTreeClassifier(), param_grid, cv=5)
grid_search.fit(X_train, y_train)

通过限制max_depth控制树的复杂度,用min_samples_split和min_samples_leaf约束叶子节点的样本量,能有效缓解过拟合。

替代模型推荐

  • RandomForestClassifier:基于集成学习的树模型,通过多棵决策树投票输出结果,大幅降低过拟合风险,同时保留了决策树的解释性,是症状-疾病分类任务的常用选择。
  • GradientBoostingClassifier:梯度提升树,通过迭代优化预测误差,精度通常优于单棵决策树和随机森林,但需要调整learning_rate和n_estimators避免过拟合。
  • LogisticRegression:作为基线模型,训练速度快,能快速验证特征的有效性,适合先跑通整体流程再切换复杂模型。

编辑补充:已解决问题。

内容的提问来源于stack exchange,提问作者Mini_TD

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.10 02:25:51