【问题标题】:IDF(Inverse Document Frequency) calculationsIDF(逆文档频率)计算
【发布时间】:2016-01-23 23:24:41
【问题描述】:

我已经计算了我的数据集的 TF,我目前正在尝试为它计算 IDF。我对使用哪个数字进行计算感到困惑。

id       uid
1         a
1         b
1         c
1         d
2         a
2         b
2         c
2         e
3         b
3         c 
3         e
3         f
(3 items)

Occurrence
a = 2
b = 3
c = 3
d = 1
e = 2
f = 1

下面是这样的:

  A B C
A - 2 2
B 2 - 3
C 2 3 -

公式

IDF(t,D)=log(Total Number documents/Number of Document matching term);

例如使用值为 2 的 (A,B):我应该如何计算它?
项目总数 = 3
文档匹配项的数量 = 我应该使用 A 值还是 B 值? (2 或 3)

(A,B) * log(total / matching)
= 2 * log ( 3 / 2 or 3) ?

【问题讨论】:

    标签: information-retrieval tf-idf


    【解决方案1】:

    我不确定你所说的 (A,B) 是什么意思。

    但我假设从您的数据集中:第一列是文档 ID,第二列是术语。

    如果我的假设是正确的,那么: doc id 1 是“a b c d” doc id 2 是“a b c e” doc id 3 是“b c e f”

    IDF(t, D) 的公式是 log(# of documents / # of documents that contains the term)。因此,我们可以为每个术语计算 IDF,如下所示:

    IDF('a', D) = log(3 / 2) IDF('b', D) = log(3 / 3) 等等……

    这是我的参考资料:https://en.wikipedia.org/wiki/Tf%E2%80%93idf

    【讨论】:

      猜你喜欢
      • 2023-03-08
      • 2017-06-13
      • 2015-01-19
      • 2014-05-18
      • 1970-01-01
      • 2014-08-19
      • 1970-01-01
      • 2015-11-23
      • 2021-02-20
      相关资源
      最近更新 更多