Python实现Pearson's r检验:计算两组变量的相关系数与p值
医疗费用数据集Pearson相关性分析代码补全
完整代码实现
# Import libraries import pandas as pd from scipy import stats # Load DataFrame df = pd.read_csv('https://tf-assets-prod.s3.amazonaws.com/tf-curric/data-analytics-bootcamp/medicalcosts.csv') # Use the 'pearsonr' correlation test to check for correlation between `age` and `charges` and print the results ac, ap = stats.pearsonr(df['age'], df['charges']) print(f"年龄与医疗费用的Pearson相关系数: {ac:.4f}, p值: {ap:.4f}") # Use the 'pearsonr' correlation test to check for correlation between `bmi` and `charges` and print the results bc, bp = stats.pearsonr(df['bmi'], df['charges']) print(f"BMI与医疗费用的Pearson相关系数: {bc:.4f}, p值: {bp:.4f}")
关键代码说明
stats.pearsonr(x, y):Scipy库中计算Pearson相关系数与p值的专用函数,输入两个等长数值数组后,返回**(相关系数, p值)**元组,可直接通过Python多变量赋值特性分配给目标变量。df['age']/df['bmi']/df['charges']:从数据集中提取对应列的数值数组,作为相关性分析的输入数据源。- 格式化输出:使用f-string将结果保留4位小数,提升输出可读性。
内容的提问来源于stack exchange,提问作者Sarah Wallace
相关产品推荐
相关产品推荐

