【问题标题】:feature selection and estimate the documents similarity in text mining文本挖掘中的特征选择和文档相似度估计
【发布时间】:2017-10-20 02:23:26
【问题描述】:

我正在开发 WEKA 库的 Java 文本挖掘项目。在预处理步骤中,我应用了 StringToWordVector 过滤器。在这个过滤器中,我设置了几个选项,例如标记化、停用词删除、词干提取和 TF-IDF 加权方案。
我有一些疑问: 1-是否有必要在每个文本挖掘项目中进行特征选择过程? 2-是否有必要估计文档的相似度,例如:使用余弦相似度? 或者这两个选项是可选的? StringToWordVector 过滤器是否可以执行其中一些操作?

【问题讨论】:

    标签: text-mining similarity feature-selection


    【解决方案1】:
    1. 没有必要。没有人强加你这一步。但结果通常会通过适当的特征选择方法得到改善。

    2. 如果这是您项目的目标,这是必要的;它不是以任何方式强加的。 StringToWordVector 过滤器仅执行此操作,将您的字符串转换为 wordVectors 以进行进一步处理或分析。这取决于您从数据中计算出的结果。如果您需要相似度度量,那么余弦距离是一个合适的度量。

    【讨论】:

      猜你喜欢
      • 2014-01-11
      • 2012-05-08
      • 1970-01-01
      • 2014-05-18
      • 1970-01-01
      • 1970-01-01
      • 2011-02-22
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多