【发布时间】:2019-06-09 02:22:59
【问题描述】:
可能有人通过示例解释“Tf 依赖于术语和文档”和“IDF 仅依赖于术语”?
【问题讨论】:
标签: information-retrieval tf-idf data-retrieval
可能有人通过示例解释“Tf 依赖于术语和文档”和“IDF 仅依赖于术语”?
【问题讨论】:
标签: information-retrieval tf-idf data-retrieval
假设我们有这两个文件:
d_1: "Tf is dependent on term and document"
d_2: "IDF is just dependent on the term"
每个文档中的词条数如下:
d_1:
{Tf: 1, is: 1, dependent: 1, on: 1, term: 1, and: 1, document: 1}
d_2:
{IDF: 1, is: 1, just: 1, dependent: 1, on: 1, the: 1, term: 1}
术语“on”的术语频率(即术语 t 在文档 d 中出现的次数与该文档的术语总数的比率)是:
tf(on, d_1) = 1 / 7
tf(on, d_2) = 1 / 7
为了计算一个词的词频,您必须指定您正在谈论的文档。 tf(on, d_1) = 1/7 告诉您 d_1 中所有单词的 1/7 是“on”。
逆文档频率(包含单词“on”的文档比率的对数)是:
idf(on) = log(2/2) = 0
如您所见,对于这个包含两个文档的语料库中的所有文档,idf 都是恒定的。它只是衡量一个术语在一组文档中的常见程度。 idf(on) = 0 告诉你“on”一点也不特别,它出现在所有文档中。
【讨论】: