【发布时间】:2017-12-04 19:42:09
【问题描述】:
“对大语料使用Tf-Idf方法的一个本质是,使用的语料越大,词项的唯一权重越多。这是因为语料中的文档大小或文档长度的增加给出了较低的概率在语料库中复制两个词项的权重值。也就是说,Tf-Idf 方案中的权重可以呈现权重的指纹。在小规模的语料库中,Tf-Idf 无法产生这种差异,因为存在巨大的发现潜力两个词条具有相同的权重,因为它们在每个文档中以相同的频率共享相同的源文档。根据语料库的大小,在抄袭检测领域使用 Tf-Idf 加权方案,该特征可以成为对手和支持者。"
这是我从 tf-idf 技术中推断出来的……是真的吗?
有什么链接或文件可以证明我的结论吗?
【问题讨论】:
-
要求链接、文档或其他场外资源的问题不属于 Stack Overflow 的主题。
标签: tf-idf