Spark写入Double类型值到Elasticsearch显示科学计数法如何解决
根因说明
这个问题是两个原因共同导致的:
- 双精度浮点数(
double类型)的固有精度限制:9999999999999.99的有效十进制位数为15位,刚好接近double类型的15~17位有效数字临界值,二进制浮点存储格式无法精确表示该十进制数,会出现自动舍入。 - Elasticsearch默认序列化规则:对于超过长度阈值的数值,会默认使用科学计数法格式返回,才会出现
9.99999999999999E12的展示结果。
解决方案
可以根据你的业务场景选择以下任意一种方案:
- 方案1:使用
scaled_float并指定匹配的缩放因子
该方案适合需要对字段做数值计算、范围查询的场景,你之前使用scaled_float未生效大概率是没有设置正确的缩放因子,针对2位小数的场景,字段映射配置如下:{ "mappings": { "properties": { "target_field": { "type": "scaled_float", "scaling_factor": 100 } } } }scaled_float会自动将原始值乘以缩放因子转为long类型存储,完全避免浮点数精度问题,返回时也会自动还原为原始的普通十进制格式,不会出现科学计数法。 - 方案2:使用
keyword类型存储
该方案适合不需要对字段做数值运算、只需要原样存储和精确匹配的场景,直接将字段类型设为keyword,存入字符串形式的9999999999999.99即可,存储和返回都会完全保留原始格式。 - 方案3:使用
long类型存储最小单位
该方案适合金额类等有明确最小单位的场景,将9999999999999.99转为最小单位(比如分)的整数值999999999999999存储为long类型,业务侧读取后自行做单位转换,从根源避免浮点数精度和展示问题。 - 方案4:仅调整返回格式不修改字段映射
如果你暂时无法修改字段映射,且对精度要求不高,可以在Elasticsearch配置中添加参数http.json_output_scientific_threshold: 0,强制所有数值都以普通十进制格式返回,不会出现科学计数法,但该方案无法解决double类型本身的精度丢失问题。
内容的提问来源于stack exchange,提问作者RAVITEJA SATYAVADA
相关产品推荐
相关产品推荐

