【发布时间】:2020-01-25 13:34:13
【问题描述】:
我一直在研究如何为深度学习模型准备数据集。
如果我们有这样的数据,
data = [['this', 'is'], ['not', 'with']]
首先他们得到我们语料库中单词的频率。基于词频整数标签被分配给词。
出现频率高的词被赋值为 1,然后是 2,以此类推..
我的问题是为什么我们需要这样做?我们不能只是为单词随机分配整数值吗?如果我们遵循该规则,它会提高准确性吗?
【问题讨论】:
标签: python tensorflow text deep-learning nlp