【问题标题】:How to calculate the tf-idf score for a phrase with a set of documents如何计算具有一组文档的短语的 tf-idf 分数
【发布时间】:2017-12-07 23:01:30
【问题描述】:

我需要计算一个短语的 tf-idf,例如:"judgment in development" 与一个抵消的文档,而不是计算 python 中单个术语的 tf-idf 分数

【问题讨论】:

    标签: scikit-learn information-retrieval tf-idf


    【解决方案1】:

    您可以使用 Scikit-learn 的 TfidfVectorizer (sklearn.feature_extraction.text.TfidfVectorizer) 的 ngram_range 属性计算短语的 tf-idf 分数。如果您将 ngram 范围输入为 (1,3),那么它将首先使用输入语料库中的 unigrams(单词)以及 bigrams 和 trigrams 创建词汇表。最终,TfidfVectorizer 将输出大小矩阵(词汇表中的术语数 * 输入语料库中的文档数)。现在您可以在此矩阵中参考短语的 tf -idf。

    您可以通过这篇不错的帖子进行详细说明 https://markhneedham.com/blog/2015/02/15/pythonscikit-learn-calculating-tfidf-on-how-i-met-your-mother-transcripts/

    希望对你有帮助!!!

    【讨论】:

      【解决方案2】:

      您可以过滤文档并仅使用包含/匹配查询词的文档,也可以将查询作为整个字符串使用而不考虑每个单词。

      【讨论】:

      • 答案过于主观......没有给出任何具体的方法来实现问题的要求
      猜你喜欢
      • 1970-01-01
      • 2023-03-04
      • 2018-11-09
      • 2019-01-10
      • 2015-11-27
      • 2018-03-23
      • 2014-04-21
      • 2017-05-30
      • 2016-09-03
      相关资源
      最近更新 更多