【发布时间】:2017-03-01 19:16:13
【问题描述】:
我有 3 个关于微调词向量的问题。请帮帮我。我会很感激的!非常感谢!
当我训练自己的 CNN 进行文本分类时,我使用 Word2vec 来初始化单词,然后我只是使用这些预训练的向量作为我的输入特征来训练 CNN,所以如果我没有嵌入层,它肯定不能通过反向传播进行任何微调。我的问题是如果我想做微调,是否意味着创建一个嵌入层?以及如何创建它?
当我们训练 Word2vec 时,我们使用的是无监督训练,对吗?就我而言,我使用skip-gram模型来获得我的预训练word2vec;但是当我有 vec.bin 并在文本分类模型 (CNN) 中使用它作为我的单词初始化器时,如果我可以微调 vec.bin 中的单词到向量映射,是否意味着我必须拥有CNN 网络结构与训练 Word2vec 时的网络结构完全相同?微调的东西会改变 vec.bin 还是只是微调计算机内存?
skip-gram 模型和 CBOW 模型是否仅用于无监督 Word2vec 训练?或者他们也可以申请其他通用文本分类任务? Word2vec 无监督训练有监督微调之间的网络有什么不同?
@Franck Dernoncourt 谢谢你提醒我。我在这里是绿色的,并希望从强大的社区中学到一些东西。有时间请看我的问题,再次感谢!
【问题讨论】:
标签: machine-learning nlp artificial-intelligence deep-learning