【发布时间】:2019-11-20 10:46:47
【问题描述】:
我正在处理文本数据,目前我已将数据放入术语文档矩阵并计算 TF,术语频率和 TF-IDF,术语频率逆文档频率。从这里我的矩阵看起来像:
列 = 文档名称
行名 = 单词
充满了他们的 TF 和 TF-IDF 分数。
在我当前的大部分分析中,我一直在使用 R 中的 tm 包,但为了更进一步,我开始在 Python 中使用 gensim 库。
我不清楚我是否有 TF 和 TF-IDF 中的词嵌入。我希望使用 Word2Vec/Doc2Vec 并获得一个类似于我目前拥有的矩阵,然后计算文档之间的余弦相似度。这是模型的输出之一吗?
我基本上有大约 6000 个文档我想计算它们之间的余弦相似度,然后对这些余弦相似度分数进行排名。
【问题讨论】:
标签: python gensim word2vec doc2vec