Pyodbc查询HIVE Decimal(11,0)字段尾零丢失问题咨询
嘿,从你遇到的情况来看,这不是你的操作问题,更像是pyodbc和Hortonworks Hive ODBC Driver之间的类型处理兼容性bug。
问题根源
Hive定义的Decimal(11,0)是固定11位的整数类型,末尾的0是数据的一部分。但pyodbc在解析这类数据时,可能把它当成了可变精度的Decimal,自动剔除了末尾的“无效”零——但对你的业务场景来说,这些零是有意义的固定位数组成部分。而Power BI这类工具的类型解析逻辑更贴合Hive的Decimal定义,所以能拿到完整值。
快速解决办法
这里有几个实用的方案,按优先级推荐:
在SQL里强制转成字符串返回
这是最直接的临时解决办法,在查询时把字段转成字符串,让pyodbc原封不动地拿到完整值:SELECT CAST(my_field AS STRING) FROM my_db.my_table WHERE my_field = 2112332230拿到结果后如果需要数值类型,再在Python里转换:
result = conn.execute(sql).fetchall() # 转成Decimal类型保留精度 fixed_value = Decimal(result[0][0]) # 或者直接转成整数 fixed_value = int(result[0][0])升级pyodbc或Hive ODBC Driver版本
你当前用的pyodbc 4.0.23是比较旧的版本(目前已经有4.0.39甚至5.x的稳定版),Hive ODBC Driver也可能存在旧版本的兼容性问题。尝试升级到两者的最新稳定版,大概率能修复这个类型解析的bug。检查pyodbc的连接参数
可以尝试在建立连接时显式设置decimal_as_float=False(默认值就是False,但有时候显式设置能触发更严谨的类型处理逻辑),不过这个方法的有效性不如前两个:conn = pyodbc.connect( "DRIVER={HORTONWORKS HIVE ODBC Driver};...", decimal_as_float=False )
验证建议
先试试第一个方案,用CAST转字符串查询,看看返回的是不是完整的2112332230。如果有效,就能快速解决问题;如果升级驱动后问题消失,那就是旧版本的bug导致的。
内容的提问来源于stack exchange,提问作者Tetlanesh

