You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何让训练后的神经网络实现非确定性输出?

解决确定性神经网络在解谜游戏中重复非法操作的方案

1. 输出动作概率分布而非单一动作

把神经网络的输出从单一分类结果改成所有合法动作的概率分布,训练时让网络学习每个动作的预期收益(比如未来奖励的期望)。当遇到非法操作被拒绝时,不要直接用最大概率的动作,而是基于概率分布进行随机采样(比如用多项式采样),这样每次即使状态不变,也有概率选择不同的动作。

  • 进阶优化:可以给非法动作的概率设置为0,或者在采样前过滤掉非法动作,只从合法动作中采样,这样能避免一开始就选到非法操作。

2. 加入探索机制(ε-贪心策略)

在训练和推理阶段引入ε-贪心策略:

  • 大部分时间(1-ε概率)选择网络预测的最优动作;
  • 小部分时间(ε概率)随机选择一个合法动作。
    ε的值可以随着训练进程逐渐降低,前期多探索,后期多利用已学到的最优策略。这样即使网络一开始输出非法动作,随机探索也能让它尝试其他合法选项,打破循环。

3. 动作空间的重新建模

不要让网络直接输出具体动作,而是输出动作的参数化表示,或者将动作分解为多个子动作的组合。比如在解谜游戏中,把“移动”分解为“方向+距离”,或者把操作拆分为多个连续决策步骤,这样网络的输出空间更大,即使某一步的参数导致非法操作,调整参数后也能生成新的合法动作。

4. 引入记忆模块(循环神经网络)

用LSTM、GRU这类循环神经网络替代普通的分类器,让网络能记住之前的动作历史(包括被拒绝的非法操作)。这样输入不仅包含当前游戏状态,还包含过去的动作序列,网络会根据历史尝试过的动作调整后续输出,自然避免重复同一非法操作。这种方法比单纯输入步数或非法次数更有效,因为它能捕捉更复杂的时间依赖关系。

5. 强化学习中的重试机制(经验回放+惩罚非法动作)

在强化学习框架中:

  • 给非法动作设置负奖励,让网络学习到非法操作会带来损失;
  • 用经验回放池存储包含非法操作的轨迹,训练时让网络从这些失败案例中学习,避免重复犯错;
  • 当检测到连续重复的非法动作时,强制触发一次随机动作,打破循环后再回到正常决策流程。

内容的提问来源于stack exchange,提问作者Gary Benson

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.31 22:41:05