【发布时间】:2019-09-21 14:43:08
【问题描述】:
我正在尝试训练 Echo 状态网络以按照强化学习的方式进行随机优化以生成文本,其中优化取决于奖励信号。
我观察到,在评估过程中,当我从概率分布中采样时,bleu 分数大于我从分布中 argmax 时的分数。差值几乎超过 0.10 分(BLEU 分数一般在 0 和 1 之间)。 我不确定为什么会这样。 需要帮助。
【问题讨论】:
标签: machine-learning neural-network deep-learning nlp reinforcement-learning