You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

自定义全局归一化Scaler逆变换出现浮点精度误差问题求助

自定义全局归一化模块问题排查与修复

问题根因

  • 错误使用numpy.min/numpy.max的initial=0参数:该参数会将0纳入最值计算范围,若输入数据的最小值大于0,会直接导致归一化逻辑错误,即使本次测试数据不受影响,也属于潜在严重bug。
  • 重复计算最值:transform方法中重复调用3次x.min()、x.max(),无意义且可能引入不必要的浮点数计算误差。
  • 浮点数精度固有误差:你看到的1.33226763e-15属于IEEE双精度浮点数的正常计算误差,量级已经可以忽略,sklearn输出无该类值是因为其默认打印配置自动隐藏了极小的科学计数法结果,并非计算逻辑完全没有误差。

修复后代码

import numpy as np


class Scaler:
    def __init__(self, feature_range: tuple = (0, 1)):
        self.scaler_min = feature_range[0]
        self.scaler_max = feature_range[1]

        self.data_min = None
        self.data_max = None
        self.data_range = None  # 提前存储数据区间,减少重复计算

    def transform(self, x: np.ndarray):
        # 移除错误的initial参数,直接取输入数据的全局最值
        self.data_min = x.min()
        self.data_max = x.max()
        self.data_range = self.data_max - self.data_min
        # 直接使用已经计算好的最值,避免重复计算
        scaled_data = (x - self.data_min) / self.data_range
        return scaled_data * (self.scaler_max - self.scaler_min) + self.scaler_min

    def inverse_transform(self, x: np.ndarray):
        scaled_data = (x - self.scaler_min) / (self.scaler_max - self.scaler_min)
        res = scaled_data * self.data_range + self.data_min
        # 可选:对极小误差做近似处理,和sklearn输出保持一致
        return np.where(np.abs(res) < 1e-10, 0, res)

效果验证说明

修复后运行你的测试代码,逆变换结果会和理论值完全一致,添加np.set_printoptions(suppress=True)也可以直接关闭numpy的极小值科学计数法显示,和sklearn的输出效果完全对齐。

内容的提问来源于stack exchange,提问作者Pro

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.27 01:54:07