Hive多表关联后仅保留单个PK列及批量列别名设置方法问询
Hive关联后去重PK列+批量列别名解决方案
一、仅保留一份PK列(无需枚举全部列)
如果你的Hive版本在2.3.0及以上,直接用EXCEPT语法就能快速排除重复的PK列,不用手动写所有列名:
WITH joined_data AS ( SELECT b.*, c.* FROM table1 b JOIN table2 c ON b.pk = c.pk ) -- 保留table1的pk,排除table2的pk SELECT b.pk, c.* EXCEPT (pk) FROM table1 b JOIN table2 c ON b.pk = c.pk; -- 也可以反过来保留table2的pk,排除table1的pk -- SELECT c.pk, b.* EXCEPT (pk)...
要是你的Hive版本低于2.3.0不支持EXCEPT,可以通过查询元数据动态生成列列表:先从information_schema.columns获取目标表除PK外的所有列名,再拼接成SQL语句执行,避免手动枚举。
二、批量给列添加前缀(如table2_前缀)
Hive本身没有b.* as table2这种直接批量加前缀的语法,但可以通过动态生成SQL实现:
- 先查询元数据获取表的列名并拼接别名:
SELECT concat('b.', column_name, ' as table2_', column_name) FROM information_schema.columns WHERE table_name = 'table1' -- 替换为你的表名,注意Hive可能区分大小写 -- 不需要给PK加前缀的话,再加个条件:AND column_name != 'pk'
- 把查询结果的字符串拼接起来,替换到主SQL中,最终生成类似这样的语句:
SELECT c.pk, b.col1 as table2_col1, b.col2 as table2_col2, -- 其他列依次拼接 c.colx, c.coly... FROM table1 b JOIN table2 c ON b.pk = c.pk;
如果是在脚本里执行,用Shell或Python自动拼接这些列名,能省不少手动操作的功夫。
内容的提问来源于stack exchange,提问作者user2543622
相关产品推荐
相关产品推荐

