TensorFlow的Adam优化器是否实现原论文中的学习率衰减机制?
TensorFlow Adam优化器的学习率衰减机制说明
- TensorFlow默认的
tf.keras.optimizers.Adam并未实现原论文定理4.1中提出的α_t = α / sqrt(t)学习率衰减机制。 - 默认配置下,它的学习率会保持初始化时设定的固定值,不会随迭代次数自动按该公式进行衰减。
- 若需要实现这种学习率衰减逻辑,你可以手动搭配学习率调度器(如
tf.keras.optimizers.schedules.LearningRateSchedule)自定义更新规则,或是将符合该公式的动态学习率传入learning_rate参数。
内容的提问来源于stack exchange,提问作者poglhar
相关产品推荐
相关产品推荐

