PySpark多DataFrame同名列(带序列号后缀)的比较问题求助
PySpark多DataFrame同名列(带序列号后缀)的比较问题求助
大家好,我现在卡在一个PySpark的问题上,折腾了好一阵子都没头绪,来社区求帮忙了!
我已经成功把n个结构完全相同的DataFrame做了关联,关联的时候为了区分不同来源的列,给每一列都加上了序列号后缀——比如原来的Test_Col1,现在变成了Test_Col1_0、Test_Col1_1……直到Test_Col1_n,最终的数据结构大概是这样的:
+------------------------------------+-----------+-----------+...+-----------+-----------+...+-----------+-----------+......+-----------+-----------+ |primary_key |Test_Col1_0|Test_Col2_0|...|Test_Col1_1|Test_Col2_1|...|Test_Col1_2|Test_Col2_2|......|Test_Col1_n|Test_Col2_n| +------------------------------------+-----------+-----------+...+-----------+-----------+...+-----------+-----------+......+-----------+-----------+ |{10002711957914718:0000000015945968}|XYZ |ABC |...|PQR |MNO |...|JKL |DEF |......|SRT |TUV | |{10014135598021497:0000000213113137}|XYZ |ABC |...|XYZ |MNO |...|XYZ |DEF |......|XYZ ...
我现在需要对这些同前缀的列做批量处理(比如比较同一主键下各版本列的差异、统计每列组内的相同值次数等),但如果手动一个个写逻辑的话,n的数量不固定,代码会非常冗余而且不灵活。有没有大佬能教教我怎么高效地实现这类批量列操作?非常感谢!
备注:内容来源于stack exchange,提问作者SSS
相关产品推荐
相关产品推荐

