【问题标题】:How to use reinforcement learning models MDP Q-learning?如何使用强化学习模型 MDP Q-learning?
【发布时间】:2019-10-12 00:37:14
【问题描述】:

我有兴趣研究强化学习,尤其是如何使用 RL 进行动态定价。我尝试阅读一些有关它的论文,并且大多数时候我看到作者尝试模拟环境以查看最佳选择的示例。

  1. https://arxiv.org/pdf/1803.09967.pdfRL 公平动态定价
  2. https://ieeexplore.ieee.org/document/1210269 - 零售市场动态定价中的强化学习应用

我试图理解,在这种情况下,每当我们有某种不确定性时,就有可能模拟环境来得到答案。每次我们有新的输入(环境和状态不同)我们运行程序去得到结果?是否可以部署 RL 模型?

我非常感谢动态定价中与 RL 相关的任何信息/链接,以及如何使用/重用 RL 模型。

【问题讨论】:

  • RL 假设您有一些方法可以模拟环境。这个想法是 RL 代理在模拟环境中“玩游戏”很多次,并在这样做的过程中学会如何玩得好。我不确定你的意思是“每次我们有新的输入(环境和状态都不同)”——如果 state 发生变化,你不会重新运行(即重新训练模型)。如果环境发生变化——例如,定价结构或需求分布发生变化——那么您需要重新培训。但如果环境发生变化,意味着您在同一环境中进入新状态,则无需重新训练。
  • @LarrySnyder610 非常感谢您的回答,我正在尝试理解 RL 的主要概念,但我认为我将 RL 与监督学习混淆了。在监督学习中,我们训练模型,然后我们可以用它来分类新的数据输入(例如:猫/狗、正/负等)。我们将此模型用于新的数据输入。
  • @LarrySnyder610 在 RL 中,假设我想预测产品服务的最佳价格。在这种情况下,我必须模拟“现实世界:假设我知道我的竞争对手对类似产品的收费是多少,我可以估计对产品的需求等等。最后,我会得到结果——什么将是最能增加我的收入的最佳价格,例如,我必须为我的产品收取 23 美元,并且以这个价格我获得最大的收入。不需要部署模型或类似的东西 - 我只是有答案吧?谢谢你的帮助!
  • 我会这样描述你的例子:你有一个真实世界的模拟器。对于您采取的任何行动(例如,您设定的任何价格),模拟器都会在多个时间段内模拟需求、竞争对手的行动等。 RL 代理反复玩游戏,并根据每个时期的环境状态学习如何在每个时期选择好的动作。
  • 多周期环境是 RL 的典型设置。如果它只是一个周期,那么你就不需要 RL,在这种设置下有更简单的收入优化模型。 (也许这就是您所说的“无需部署模型”的意思?)

标签: model reinforcement-learning


【解决方案1】:

RL 假设您有某种方法可以模拟环境。这个想法是 RL 代理在模拟环境中“玩游戏”很多次,并且在这样做的过程中它学会了如何玩得好。我不确定你的意思是“每次我们有新的输入(环境和状态都不同)”——如果状态发生变化,你不会重新运行(即重新训练模型)。如果环境发生变化——例如,定价结构或需求分布发生变化——那么你需要重新培训。但是,如果环境发生变化,意味着您在同一环境中进入新状态,您无需重新训练。

对于动态定价,RL 可以这样工作:你有一个真实世界的模拟器。对于您采取的任何行动(例如,您设定的任何价格),模拟器都会在多个时间段内模拟需求、竞争对手的行动等。 RL 智能体反复玩游戏,并根据每个时期的环境状态学习如何在每个时期选择好的动作。

多周期环境是 RL 的典型设置。如果它只是一个时期,那么你就不需要 RL,在这种设置下有更简单的收入优化模型。

【讨论】:

    猜你喜欢
    • 2018-06-09
    • 1970-01-01
    • 1970-01-01
    • 2018-11-17
    • 2016-03-14
    • 1970-01-01
    • 2019-02-20
    • 2018-11-04
    • 2021-09-14
    相关资源
    最近更新 更多