You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何基于数值非递增条件实现数据集分段求平均值?

修正后的代码及解释

原代码存在的问题

  • 错误的前元素访问方式:df.loc[i, 'list1' -1] 是无效的,因为不能对字符串列名做减法运算,正确写法应为 df.loc[i-1, 'list1']。
  • 循环内重复初始化结果列表:每次触发条件时都执行 res = [],会清空之前的结果,导致最终只保留最后一次计算的平均值。
  • 分段范围错误:sum(df["list1"][i:i+len(df['list1'])]) 计算的是从当前索引到数据集末尾的总和,而非当前分段的总和。
  • 未处理最后一段数据:循环结束后,最后一个分段(从最后一次分割点到数据集末尾)未被计算。

修正后的代码

import pandas as pd

# 示例数据集
data = {'list1': [2, 3, 4, 5, 5, 6, 7, 8, 8]}
df = pd.DataFrame(data)

res = []
start_idx = 0
target_col = 'list1'

# 从第二个元素开始遍历
for i in range(1, len(df)):
    # 判断当前数值是否小于等于前一个数值
    if df.loc[i, target_col] <= df.loc[i-1, target_col]:
        # 计算当前分段的平均值(从start_idx到i-1)
        segment = df.loc[start_idx:i-1, target_col]
        avg = segment.mean()
        res.append(avg)
        # 更新下一个分段的起始索引
        start_idx = i

# 处理最后一段数据
last_segment = df.loc[start_idx:, target_col]
res.append(last_segment.mean())

# 输出结果
print(', '.join(map(str, res)))

代码说明

  1. 初始化变量:start_idx 记录当前分段的起始索引,res 存储各分段的平均值。
  2. 遍历数据集:从第二个元素开始,检查当前元素是否小于等于前一个元素。
  3. 分段计算:当触发条件时,计算从 start_idx 到当前索引前一位的分段平均值,加入结果列表,并更新起始索引。
  4. 处理最后一段:循环结束后,处理剩余的最后一段数据并计算平均值。

结果说明

运行上述代码后,示例数据集的输出为 3.5, 6.5, 8。与你预期的 3.5, 7 存在差异,可能是因为:

  • 你希望排除长度为1的最后一段(仅包含最后一个8),可在添加最后一段前判断长度:
    if len(last_segment) > 1:
        res.append(last_segment.mean())
    
    此时输出为 3.5, 6.5。
  • 或预期输出存在笔误,6.5 四舍五入后为7。

内容的提问来源于stack exchange,提问作者Amber

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.28 10:52:54