You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas匹配p{n}格式列名并批量创建对应计算列的实现方法

Pandas 自定义列检测与t列生成实现

核心是用严格首尾锚定的正则表达式匹配符合规则的p列,从根源避免误匹配,且完全不依赖列的位置索引,适配列顺序混乱的数据集。


实现逻辑

  • 匹配规则:仅识别列名完全符合p + 正整数格式的列,类似price、p1_ver2、ap3这类带字符p但不符合格式的列会被直接过滤
  • 自动提取列名里的数字n,按n的数值升序排列,避免字符串排序导致的顺序错乱(比如p10排在p2前的问题)
  • 按t_n = p_n - current的规则批量计算生成新列,可自主选择是否覆盖已存在的同名t列

可直接运行的代码

import re

# 1. 定义严格匹配规则:^表示列名开头,$表示列名结尾,中间p后面必须全是数字
p_col_pattern = re.compile(r'^p(\d+)$')
valid_p_cols = []

# 2. 遍历所有列名,筛选符合规则的p列
for col_name in df1.columns:
    match_result = p_col_pattern.match(col_name)
    if match_result:
        n_val = int(match_result.group(1))
        valid_p_cols.append( (n_val, col_name) )

# 3. 按n值从小到大排序,保证生成顺序符合n=1、2、3...的要求
valid_p_cols.sort(key=lambda x: x[0])

# 4. 批量生成t列
for n, p_col in valid_p_cols:
    t_col = f't{n}'
    # 👇 如果不需要覆盖已存在的t列,放开下面这行注释即可
    # if t_col in df1.columns:
    #     continue
    df1[t_col] = df1[p_col] - df1['current']

效果说明

针对提供的测试样例df1,运行后会自动识别p1、p2、p3、p4四列,生成对应的t1-t4列:

  • 原有的非规则列(比如示例里的其他无关列、带p但格式不对的列)完全不会被处理
  • 不管p列在数据集的哪个位置,都能被准确识别
  • 计算结果完全符合t_n = p_n - current的规则

内容的提问来源于stack exchange,提问作者n3a5p7s9t1e3r

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.27 20:42:19