通过HQL从CDP拉取数据至Python:移除数组列的b''标识
问题描述
通过Hive查询语言(HQL)从Cloudera Data Platform(CDP)拉取数据到Python时,发现某列在Hive中为array类型,但查询结果里该列值带有b''标识,示例如下:
0 b'[1152]' 1 b'[1600,128,192,128,0,384,256]' 2 b'[2752]' 3 b'[384,192]' 4 b'[1152,448]'
希望避免在Python中做数据处理(效率较低),想了解b''是什么,以及如何在不增加数字间空格的前提下移除它们,预期输出:
0 [1152] 1 [1600,128,192,128,0,384,256] 2 [2752] 3 [384,192] 4 [1152,448]
解答
1. b''的含义
b''是Python对**字节串(bytes)**的标记,意味着Hive返回的array类型数据没有被正确序列化为Python列表,而是以原始字节字符串的形式传输。这是因为Hive的JDBC/ODBC驱动在序列化array类型时,默认输出了其字符串化的字节形式,而非直接转换为Python可识别的结构。
2. HQL层面的解决方案(无需Python处理)
方法一:直接将array转为目标格式字符串
使用Hive内置函数CONCAT_WS拼接数组元素,再手动包裹方括号,拉取数据时直接得到符合预期的字符串格式:
SELECT -- 保留其他需要的字段 CONCAT('[', CONCAT_WS(',', your_array_column), ']') AS formatted_array FROM your_target_table;
该写法会直接输出[1152]、[1600,128,...]这类格式,完全符合预期,且所有处理都在Hive端完成,避免了Python端的转换开销。
方法二:调整连接驱动配置(可选)
如果使用PyHive或JDBC连接CDP,可在连接参数中指定序列化规则,让驱动自动将Hive array转为Python列表:
- 例如使用PyHive时,确保连接参数配置正确,或在JDBC URL中添加
hive.resultset.use.unique.column.names=false等适配参数(具体需结合CDP的Hive版本调整)。不过这种方式不如方法一直接可控。
注意事项
- 方法一兼容性强,能自动处理空array的情况(返回
[]); - 完全在Hive端处理数据,避免了Python端的字节串转换操作,效率更高。
内容的提问来源于stack exchange,提问作者user2543622
相关产品推荐
相关产品推荐

