【发布时间】:2022-11-17 00:39:22
【问题描述】:
我正在创建一个基本的网格世界 RL 问题,我需要计算某些给定情节的回报。我目前有奖励数组,我想按元素将其与以下形式的列表相乘:
[gamma**0, gamma**1, gamma**2, ....]
为了得到:
[r_0*gamma**0, r_1*gamma**1, r_2*gamma**2, ....]
然后使用 np.sum() 获得全部回报。
我怎样才能完成第一步?我尝试使用 Logspace,但它并不是我想要的(或者我做错了)。
【问题讨论】:
标签: python arrays numpy reinforcement-learning