【发布时间】:2017-10-20 02:23:26
【问题描述】:
我正在开发 WEKA 库的 Java 文本挖掘项目。在预处理步骤中,我应用了 StringToWordVector 过滤器。在这个过滤器中,我设置了几个选项,例如标记化、停用词删除、词干提取和 TF-IDF 加权方案。
我有一些疑问:
1-是否有必要在每个文本挖掘项目中进行特征选择过程?
2-是否有必要估计文档的相似度,例如:使用余弦相似度?
或者这两个选项是可选的?
StringToWordVector 过滤器是否可以执行其中一些操作?
【问题讨论】:
标签: text-mining similarity feature-selection