FPGA 128位位宽约束下长无符号定点数乘法实现方法咨询
合并方法
首先明确拆分的数学关系:你把150位的a拆分为 a = (a_msb << 128) + a_lsb,其中a_lsb是低128位的Ufix128_70定点数,a_msb是高22位的无符号整数(对应a中的位权为258~279)。
乘积展开后为:a*b = a_msb*b * 2^58 + a_lsb*b
对齐两个乘积的小数点即可直接相加:
a_lsb * b的完整结果为Ufix182_123(位宽128+54=182,小数位70+53=123)a_msb * b的完整结果为Ufix76_53(位宽22+54=76,小数位0+53=53)
将a_msb * b的存储整数值左移70位(对应小数位补70个0,对齐123位小数位),就可以和a_lsb * b的存储整数值直接相加,所得结果即为总乘积的无符号整数存储值,除以2^123就是乘积的实际数值。
减少精度损失的优化方案
- 延后截位:不要在计算
a_msb*b和a_lsb*b时就提前截断到128位,先保留两个乘积的完整位宽,完成相加后再统一做截位处理,避免多次截位累积误差。 - 舍入策略:最终需要截断到128位时,优先用四舍五入而非直接截断:判断要丢弃的最高位的值,若为1则给保留的最低位加1,同时做饱和判断避免溢出。
- 位宽分配优化:先计算乘积的最大整数位需求:
a和b都取最大值时,乘积约为2^81,整数部分最多81位。如果使用128位存储最终结果,可以分配47位小数位(128-81=47),刚好容纳所有可能的乘积结果无溢出,同时保留最多的小数精度。
内容的提问来源于stack exchange,提问作者Quang Thinh Ha
相关产品推荐
相关产品推荐

