【发布时间】:2018-10-17 21:59:15
【问题描述】:
当我对用自然语言编写的文档进行分类和聚类时,我想到了一个问题......
由于word2vec和glove等对分布式空间中的单词进行向量化,不知道有没有推荐或常用的文档向量化方法使用词向量。
例如,
Document1:“如果你追逐两只兔子,你会同时失去它们。”
可以向量化为,
[0.1425, 0.2718, 0.8187, .... , 0.1011]
我知道一个也称为 doc2vec 的文档,这个文档有 n 个维度,就像 word2vec 一样。但这是 1 x n 尺寸,我一直在测试以找出使用 doc2vec 的限制。
所以,我想知道其他人如何将词向量应用于具有稳定大小的应用程序。
只需将带有 m 个单词的向量堆叠起来,就可以形成 m x n 维向量。在这种情况下,向量维度将不统一,因为维度 m 将取决于文档中的单词数。
如果:[0.1018, ... , 0.8717]
你:[0.5182, ... , 0.8981]
..:[...]
第 m 个单词:[...]
而且这种形式不利于运行一些机器学习算法,例如 CNN。使用词向量生成稳定形式的文档向量的建议方法是什么?
如果能附上论文就好了。
谢谢!
【问题讨论】:
标签: machine-learning nlp vectorization word2vec doc2vec