如何用PySpark向Hive分区表追加数据并优化分区字段处理
分区表数据追加的疑问
我在项目中基于Hadoop-Hive结合PySpark进行数据操作,首先通过以下SQL创建了一张分区表:
CREATE TABLE target_db.target_table( id string) PARTITIONED BY ( user_name string, category string)
目前有一批待写入的数据:
user_name: john data list: # id, category [('1', 'warrior'), ('2', 'warrior'), ('3', 'knight'), ...]
需要将这批数据以append模式追加到target_db.target_table中。
尝试的方案
- 最初的方案可运行,但实际场景中无法获取
category_list,且必须使用append模式(不能用overwrite),因此该方案不可行。 - 后续找到的可行方案需要手动为每条数据添加重复的
user_name字段,我认为这种方式效率较低,希望找到更优方案。 - 调整后采用
withColumn添加user_name字段的方案可行,但我有以下疑问:- 该方案的内部原理是什么?
- 和手动添加
user_name字段的方案效果是否一致? - Spark是否会对作为分区字段的
user_name进行存储优化?
内容的提问来源于stack exchange,提问作者Redwings
相关产品推荐
相关产品推荐

