You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用PySpark/Pandas按列名模式匹配对多列求和生成新列

实现方案

Pandas 实现

直接用DataFrame的filter方法配合正则匹配目标列,再沿行方向求和即可:

import pandas as pd

# 示例df构造可根据实际业务替换
# df = pd.read_csv("your_data.csv")

# 匹配规则列并逐行求和生成新列
df["plain_sum"] = df.filter(regex=r"^plain-prod.*", axis=1).sum(axis=1)

*说明:默认求和会自动忽略空值,如果需要空值参与计算时结果返回NaN,可给sum方法添加参数skipna=False。

PySpark 实现

先通过正则筛选出符合规则的列名,再对多列做逐行相加生成新列:

import re
from pyspark.sql import SparkSession
from pyspark.sql.functions import col, coalesce

# 初始化SparkSession,实际场景可直接复用已有实例
spark = SparkSession.builder.appName("col_sum_calc").getOrCreate()
# 示例df构造可根据实际业务替换
# df = spark.read.csv("your_data.csv", header=True, inferSchema=True)

# 正则匹配目标列
matched_cols = [c for c in df.columns if re.match(r"^plain-prod.*", c)]
# 逐行求和,coalesce用于把空值转为0,避免空值导致求和结果为NULL
df = df.withColumn(
    "plain_sum",
    sum(coalesce(col(c), 0) for c in matched_cols)
)

*说明:如果不需要忽略空值,去掉coalesce处理逻辑,直接写sum(col(c) for c in matched_cols)即可。

内容的提问来源于stack exchange,提问作者Sudhin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 13:06:08