【发布时间】:2016-06-29 02:46:56
【问题描述】:
我知道 gensim 中的 word2vec 可以计算单词之间的相似度。但现在我想使用 TF-IDF 或 LSA 和 gensim 来计算单词相似度。怎么做?
注意:使用 LSA 和 gensim 计算文档相似度很容易:http://radimrehurek.com/gensim/wiki.html
【问题讨论】:
标签: python nlp tf-idf gensim lsa
我知道 gensim 中的 word2vec 可以计算单词之间的相似度。但现在我想使用 TF-IDF 或 LSA 和 gensim 来计算单词相似度。怎么做?
注意:使用 LSA 和 gensim 计算文档相似度很容易:http://radimrehurek.com/gensim/wiki.html
【问题讨论】:
标签: python nlp tf-idf gensim lsa
TF-IDF 是一种加权方案所以it's not an alternative to LSA.
把你的问题想象成一个由“n”个文档组成的“m”个词的矩阵。矩阵的每个条目 Aij 代表文档“j”中术语“i”的权重。这是您使用 TF-IDF 的地方。知道要在矩阵的每个单元格中放入什么。
然后,如果它适合您的应用程序,您可以使用 LSA 减少矩阵的维度。
我希望这能解决一点问题。
【讨论】: