【发布时间】:2018-04-08 07:46:16
【问题描述】:
sequence to sequence learning 是一种强大的语言翻译机制,尤其是在特定上下文的本地情况下使用它。
我正在关注this pytorch tutorial 的任务。
但是,本教程并未将数据拆分为训练和测试。 您可能认为这没什么大不了的,只需将其拆分,一个用于训练,另一个用于测试。但事情没那么简单。
本质上,本教程在引导数据集的同时创建所见单词的索引。索引只是存储在字典中。这是在进入编码器 RNN 之前,只是一个从单词到数字的简单转换任务。
如果数据被随机拆分,会发生什么情况,其中一个关键字可能不会出现在训练集中的句子中,因此可能根本没有索引。如果在测试的时候出现,应该怎么办?
扩展字典?
【问题讨论】:
-
如果你得到一个看不见的词,那不是测试失败吗?
-
@Jasen,我真的不认为这是一个失败的测试,必须有一些解决方法。否则,在现实世界中使用它根本不切实际,不是吗?我的意思是,这不是机器学习的全部想法吗?如果事先知道所有单词,那么保留一个哈希图来说明当这个单词到达时要做什么。如果您有其他想法,请纠正我..
标签: machine-learning tensorflow nlp recurrent-neural-network pytorch