【发布时间】:2019-10-12 00:37:14
【问题描述】:
我有兴趣研究强化学习,尤其是如何使用 RL 进行动态定价。我尝试阅读一些有关它的论文,并且大多数时候我看到作者尝试模拟环境以查看最佳选择的示例。
- https://arxiv.org/pdf/1803.09967.pdfRL 公平动态定价
- https://ieeexplore.ieee.org/document/1210269 - 零售市场动态定价中的强化学习应用
我试图理解,在这种情况下,每当我们有某种不确定性时,就有可能模拟环境来得到答案。每次我们有新的输入(环境和状态不同)我们运行程序去得到结果?是否可以部署 RL 模型?
我非常感谢动态定价中与 RL 相关的任何信息/链接,以及如何使用/重用 RL 模型。
【问题讨论】:
-
RL 假设您有一些方法可以模拟环境。这个想法是 RL 代理在模拟环境中“玩游戏”很多次,并在这样做的过程中学会如何玩得好。我不确定你的意思是“每次我们有新的输入(环境和状态都不同)”——如果 state 发生变化,你不会重新运行(即重新训练模型)。如果环境发生变化——例如,定价结构或需求分布发生变化——那么您需要重新培训。但如果环境发生变化,意味着您在同一环境中进入新状态,则无需重新训练。
-
@LarrySnyder610 非常感谢您的回答,我正在尝试理解 RL 的主要概念,但我认为我将 RL 与监督学习混淆了。在监督学习中,我们训练模型,然后我们可以用它来分类新的数据输入(例如:猫/狗、正/负等)。我们将此模型用于新的数据输入。
-
@LarrySnyder610 在 RL 中,假设我想预测产品服务的最佳价格。在这种情况下,我必须模拟“现实世界:假设我知道我的竞争对手对类似产品的收费是多少,我可以估计对产品的需求等等。最后,我会得到结果——什么将是最能增加我的收入的最佳价格,例如,我必须为我的产品收取 23 美元,并且以这个价格我获得最大的收入。不需要部署模型或类似的东西 - 我只是有答案吧?谢谢你的帮助!
-
我会这样描述你的例子:你有一个真实世界的模拟器。对于您采取的任何行动(例如,您设定的任何价格),模拟器都会在多个时间段内模拟需求、竞争对手的行动等。 RL 代理反复玩游戏,并根据每个时期的环境状态学习如何在每个时期选择好的动作。
-
多周期环境是 RL 的典型设置。如果它只是一个周期,那么你就不需要 RL,在这种设置下有更简单的收入优化模型。 (也许这就是您所说的“无需部署模型”的意思?)
标签: model reinforcement-learning