【问题标题】:Reinforcement learning with neural networks使用神经网络进行强化学习
【发布时间】:2010-05-01 09:56:06
【问题描述】:
  • 我正在使用 RL 和 NN 开展一个项目
  • 我需要确定将馈送到神经网络的动作向量结构​​..

我有 3 个不同的动作(A & B & Nothing),每一个都有不同的权力(例如 A100 A50 B100 B50) 我想知道将这些动作提供给 NN 以获得最佳结果的最佳方式是什么?

1- 将 A/B 馈入输入 1,而动作功率 100/50/无输入 2

2-喂A100/A50/无输入1,而B100/B50/无输入2

3- A100/A50 输入 1,B100/B50 输入 2,Nothing 标志输入 3

4- 还要喂 100 和 50 或将它们归一化为 2 和 1?

我需要选择一种方法的理由 推荐任何建议

谢谢

【问题讨论】:

  • 有多少个输出,以及您希望在各种输入上发生什么?除非您指定什么是“最佳结果”,否则没有人能够帮助您。 (顺便说一句,有多少输入,它们应该如何交互?)

标签: machine-learning neural-network reinforcement-learning markov


【解决方案1】:

你想学什么?输出应该是什么? 输入只是使用的动作吗?如果是学习环境的模型,用概率分布表示:

P(next_state|state, action)

通常为每个操作使用单独的模型。 这使得输入和输出之间的映射更简单。 输入是状态特征向量。输出是下一个状态的特征向量。使用的动作由模型暗示。

状态特征可以被编码为比特。一个活动位表示存在一个特征。

这将学习确定性模型。我不知道什么是学习下一个状态的随机模型的好方法。一种可能是使用随机神经元。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2018-09-07
    • 2012-05-30
    • 1970-01-01
    • 2020-11-24
    • 2016-07-11
    • 2021-05-06
    • 2011-01-28
    • 2019-06-30
    相关资源
    最近更新 更多