【问题标题】:How to compute word similarity using TF-IDF or LSA with gensim?如何使用 TF-IDF 或 LSA 和 gensim 计算单词相似度?
【发布时间】:2016-06-29 02:46:56
【问题描述】:

我知道 gensim 中的 word2vec 可以计算单词之间的相似度。但现在我想使用 TF-IDF 或 LSA 和 gensim 来计算单词相似度。怎么做?

注意:使用 LSA 和 gensim 计算文档相似度很容易:http://radimrehurek.com/gensim/wiki.html

【问题讨论】:

    标签: python nlp tf-idf gensim lsa


    【解决方案1】:

    TF-IDF 是一种加权方案所以it's not an alternative to LSA.

    把你的问题想象成一个由“n”个文档组成的“m”个词的矩阵。矩阵的每个条目 Aij 代表文档“j”中术语“i”的权重。这是您使用 TF-IDF 的地方。知道要在矩阵的每个单元格中放入什么。

    然后,如果它适合您的应用程序,您可以使用 LSA 减少矩阵的维度。

    我希望这能解决一点问题。

    【讨论】:

    • 我想用gensim,怎么做?
    • 嗨@hankaixyz,但在你最初的问题中你没有提到吗?
    猜你喜欢
    • 2017-11-14
    • 1970-01-01
    • 2017-02-03
    • 2012-04-27
    • 2010-12-31
    • 2018-03-21
    • 2017-04-07
    • 2016-08-07
    • 1970-01-01
    相关资源
    最近更新 更多