STEM应用统计课程数据集预处理报错及描述性统计求助
温度数据集统计分析问题排查与解决方案
一、报错排查要点
由于未提供具体报错信息,针对第3-5步的常见问题,可从以下方向排查:
- 检查数据输入:原数据中
91,93的格式是否有误(缺少空格可能导致数据被识别为字符串或错误数值),确保所有温度值都是整数类型,无多余标点或非数值字符 - 验证代码语法:确认创建DataFrame时的语法正确,比如列表括号是否闭合、列名是否加引号,变量名无拼写错误
- 确认依赖环境:检查pandas是否已正确安装并导入,开头需有
import pandas as pd - 检查数据结构:确保数据被正确转换为列表/数组,没有混入字符串或其他非数值元素
二、正确的统计量计算代码
以下是基于pandas DataFrame的完整实现,可直接运行计算所需统计量:
import pandas as pd # 整理后的温度数据集 temp_data = [102, 97, 88, 79, 82, 91, 95, 91, 93, 97, 104, 106, 106, 100] # 创建DataFrame并指定列名 temp_df = pd.DataFrame(temp_data, columns=["Daily_Temperature"]) # 计算各统计量 mean = temp_df["Daily_Temperature"].mean() median = temp_df["Daily_Temperature"].median() sample_variance = temp_df["Daily_Temperature"].var(ddof=1) # 样本方差 sample_std = temp_df["Daily_Temperature"].std(ddof=1) # 样本标准差 desc_stats = temp_df.describe() # 输出结果 print(f"均值: {mean:.2f}") print(f"中位数: {median}") print(f"样本方差: {sample_variance:.2f}") print(f"样本标准差: {sample_std:.2f}") print("\n完整描述性统计:") print(desc_stats)
代码说明
ddof=1用于计算样本统计量(符合统计课程中常用的样本方差/标准差定义),若需总体统计量可将ddof设为0describe()方法会自动生成包含计数、均值、标准差、最小值、四分位数、最大值的完整描述性统计结果
内容的提问来源于stack exchange,提问作者Trish Jackson
相关产品推荐
相关产品推荐

