Python新手如何下载指定糖尿病数据集并使用pd.read_csv读取?
面向纯新手的Python逻辑回归糖尿病预测全流程指南
1. 前置环境准备
- 首先确保你已经安装了Python环境,以及数据分析、建模必备的第三方库。如果还没安装依赖库,打开Windows的命令提示符、Mac/Linux的终端,输入以下命令执行安装:
pip install pandas numpy scikit-learn
2. 数据集获取操作
必须先将数据集下载到本地磁盘,操作步骤如下:
- 找到Kaggle平台的皮马印第安人糖尿病数据集页面,点击下载按钮获取压缩包,解压后得到后缀为
.csv的数据集文件 - 建议把解压后的csv文件放到你后续要写Python代码的同一个文件夹里,后续读取数据时不需要写很长的文件路径,不容易出错
3. 数据集读取与初步校验
打开代码编辑器,按顺序编写执行以下代码:
# 导入pandas库 import pandas as pd # 读取csv文件,括号里填你自己的文件路径 # 如果csv和代码在同一个文件夹,直接写文件名即可,比如df = pd.read_csv("diabetes.csv") # 如果不在同一个文件夹,Windows系统可以写r"C:\Users\你的用户名\下载\diabetes.csv",Mac系统写"/Users/你的用户名/Downloads/diabetes.csv" df = pd.read_csv("你的csv文件路径") # 打印前5行数据,确认数据读取正确 print(df.head()) # 检查数据集有没有缺失值,新手很容易因为缺失值导致后续建模报错 print(df.isnull().sum())
4. 数据预处理(建模前必须完成)
这一步是把原始数据转换成逻辑回归模型能接受的格式:
# 拆分特征和标签:除了最后一列Outcome是标签(1代表患糖尿病、0代表未患病),其余列都是用来预测的特征 X = df.drop(columns=["Outcome"]) y = df["Outcome"] # 拆分训练集和测试集:80%数据用来训练模型,20%数据用来检验模型效果 from sklearn.model_selection import train_test_split X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42) # 特征标准化:逻辑回归对特征数值的尺度敏感,标准化后模型效果更稳定 from sklearn.preprocessing import StandardScaler scaler = StandardScaler() X_train_scaled = scaler.fit_transform(X_train) X_test_scaled = scaler.transform(X_test)
5. 逻辑回归模型训练与概率预测
# 导入逻辑回归类 from sklearn.linear_model import LogisticRegression # 初始化模型 model = LogisticRegression() # 用训练集数据训练模型 model.fit(X_train_scaled, y_train) # 输出测试集样本的分类结果(1/0) y_pred = model.predict(X_test_scaled) # 输出测试集样本的糖尿病发病概率,取输出结果的第二列就是患病概率 y_proba = model.predict_proba(X_test_scaled)[:, 1]
6. 模型效果校验
可以用常见指标判断模型的预测效果:
from sklearn.metrics import accuracy_score, confusion_matrix # 输出模型在测试集上的预测准确率 print("测试集准确率:", accuracy_score(y_test, y_pred)) # 输出混淆矩阵,看正/负样本的预测正确数量 print("混淆矩阵:\n", confusion_matrix(y_test, y_pred))
内容的提问来源于stack exchange,提问作者raghav khanna
相关产品推荐
相关产品推荐

