【发布时间】:2017-12-07 23:01:30
【问题描述】:
我需要计算一个短语的 tf-idf,例如:"judgment in development" 与一个抵消的文档,而不是计算 python 中单个术语的 tf-idf 分数
【问题讨论】:
标签: scikit-learn information-retrieval tf-idf
我需要计算一个短语的 tf-idf,例如:"judgment in development" 与一个抵消的文档,而不是计算 python 中单个术语的 tf-idf 分数
【问题讨论】:
标签: scikit-learn information-retrieval tf-idf
您可以使用 Scikit-learn 的 TfidfVectorizer (sklearn.feature_extraction.text.TfidfVectorizer) 的 ngram_range 属性计算短语的 tf-idf 分数。如果您将 ngram 范围输入为 (1,3),那么它将首先使用输入语料库中的 unigrams(单词)以及 bigrams 和 trigrams 创建词汇表。最终,TfidfVectorizer 将输出大小矩阵(词汇表中的术语数 * 输入语料库中的文档数)。现在您可以在此矩阵中参考短语的 tf -idf。
您可以通过这篇不错的帖子进行详细说明 https://markhneedham.com/blog/2015/02/15/pythonscikit-learn-calculating-tfidf-on-how-i-met-your-mother-transcripts/
希望对你有帮助!!!
【讨论】:
您可以过滤文档并仅使用包含/匹配查询词的文档,也可以将查询作为整个字符串使用而不考虑每个单词。
【讨论】: