如何统计DataFrame中每行相邻数值的上升/下降次数
实现方案
直接用Pandas内置的向量化差分操作即可,性能远高于逐行遍历的实现,具体逻辑和代码如下:
核心思路
对每行的所有时序数值列沿水平方向做相邻差分:
- 差分结果大于0的次数就是上升总次数
- 差分结果小于0的次数就是下降总次数
代码示例
import pandas as pd # 构造示例数据,实际使用时替换为你自己的DataFrame即可 df = pd.DataFrame({ 'yr': [1976], 'value1': [1], 'value2': [2], 'value3': [1], 'value4': [4] }) # 筛选需要计算的数值列,这里用filter匹配列名带value的列,也可以手动传列名列表比如['value1','value2','value3','value4'] value_cols = df.filter(like='value').columns # 沿行方向计算相邻值的差分 row_diff = df[value_cols].diff(axis=1) # 统计升降次数 df['#increases'] = (row_diff > 0).sum(axis=1) df['#decreases'] = (row_diff < 0).sum(axis=1)
运行后输出的df就会自带计算好的两列统计值,和你给出的示例结果完全一致。
额外说明
如果你的数据存在空值,默认情况下NaN在布尔判断时会被识别为False,不会被计入升降次数,符合大多数场景的需求;如果需要特殊处理空值,可以在计算差分后新增row_diff = row_diff.fillna(0)之类的逻辑自行调整。
内容的提问来源于stack exchange,提问作者BoostedChimp
相关产品推荐
相关产品推荐

