【发布时间】:2014-01-11 13:05:07
【问题描述】:
我们正在完成一项关于文本分类的任务,并且我们使用了一种无监督机器学习模型。
在我们进行文本聚类之前,数据集必须经过几个步骤,例如从停用词中清除它,从文本中提取词干词,然后获取特征选择。
阅读特征选择,我可以应用多种方法进行特征选择,例如信息增益、基尼指数和互信息。
我想知道这些方法的性质以及如何在编码部分实现它们,是否有任何库可以用来执行这些任务。
【问题讨论】:
-
您使用的是哪个数据集?
-
您是如何对 .sgm 文件(路透社数据集)执行 Perprocessing 的?
-
我用的是斯坦福图书馆。
-
ok 输出是 .arff 格式(我的意思是 filename.arff)?
-
是的,它的。我如何进行特征选择。
标签: java nlp weka text-mining feature-selection