【发布时间】:2016-04-22 00:23:47
【问题描述】:
如果文档属于体育、娱乐、政治,我想对它们进行分类。我创建了一个单词包,输出如下内容:
(1, 'saurashtra') (1,'saumyajit') (1, 'satyendra')
我想使用 Spark mllib 实现用于分类的朴素贝叶斯算法。我的问题是如何将此输出转换为可以朴素贝叶斯用作 RDD 等分类的输入的东西,或者如果有任何技巧我可以直接将 html 文件转换为 mllib 朴素贝叶斯可以使用的东西。
【问题讨论】:
标签: python apache-spark-mllib naivebayes document-classification