You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

PySpark多DataFrame同名列(带序列号后缀)的比较问题求助

PySpark多DataFrame同名列(带序列号后缀)的比较问题求助

大家好,我现在卡在一个PySpark的问题上,折腾了好一阵子都没头绪,来社区求帮忙了!

我已经成功把n个结构完全相同的DataFrame做了关联,关联的时候为了区分不同来源的列,给每一列都加上了序列号后缀——比如原来的Test_Col1,现在变成了Test_Col1_0、Test_Col1_1……直到Test_Col1_n,最终的数据结构大概是这样的:

+------------------------------------+-----------+-----------+...+-----------+-----------+...+-----------+-----------+......+-----------+-----------+
|primary_key                         |Test_Col1_0|Test_Col2_0|...|Test_Col1_1|Test_Col2_1|...|Test_Col1_2|Test_Col2_2|......|Test_Col1_n|Test_Col2_n|
+------------------------------------+-----------+-----------+...+-----------+-----------+...+-----------+-----------+......+-----------+-----------+
|{10002711957914718:0000000015945968}|XYZ        |ABC        |...|PQR        |MNO        |...|JKL        |DEF        |......|SRT        |TUV        |
|{10014135598021497:0000000213113137}|XYZ        |ABC        |...|XYZ        |MNO        |...|XYZ        |DEF        |......|XYZ        ...

我现在需要对这些同前缀的列做批量处理(比如比较同一主键下各版本列的差异、统计每列组内的相同值次数等),但如果手动一个个写逻辑的话,n的数量不固定,代码会非常冗余而且不灵活。有没有大佬能教教我怎么高效地实现这类批量列操作?非常感谢!

备注:内容来源于stack exchange,提问作者SSS

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.16 07:44:33