【问题标题】:Information retrieval system信息检索系统
【发布时间】:2017-06-19 02:29:22
【问题描述】:

TF-IDF文档排序和二元独立模型排序有什么区别?我无法区分它们。

我认为二进制独立模型的实际实现会导致 TF-IDF。如果我错了,请帮助我。

【问题讨论】:

  • 你是对的...... tf-idf 是临时的......概率分析确定了为什么像 tf-idf 这样的函数应该运行良好......

标签: information-retrieval


【解决方案1】:

你是对的。 Binary Independence Model 假设是文档是二进制向量。也就是说,仅记录文档中是否存在术语。另一方面,根据Vector Space Model 的说法,文档是由术语权重的向量表示的,TF-IDF 只是表示术语权重的一种方式。

【讨论】:

    【解决方案2】:

    主要区别在于,在二元独立模型中,不知道单词的重要性,并且所有单词都被同等对待。但是使用 TF-IDF 对单词进行加权会给在一个文档中使用较多且文档频率较低的单词提供更好的分数。

    【讨论】:

      猜你喜欢
      • 2021-07-17
      • 1970-01-01
      • 2012-02-02
      • 1970-01-01
      • 2020-05-24
      • 2011-03-22
      • 2017-03-06
      • 2023-03-19
      • 2023-03-28
      相关资源
      最近更新 更多