【发布时间】:2015-07-02 16:15:53
【问题描述】:
我正在构建一个进行文本分类的系统。我正在用 Java 构建系统。作为功能,我使用的是词袋模型。然而,这种模型的一个问题是特征数量非常多,这使得无法将数据拟合到内存中。
但是,我从 Scikit-learn 发现了这个 tutorial,它使用特定的数据结构来解决问题。
我的问题:
1 - 人们一般如何使用 Java 解决此类问题?
2- 有没有类似于scikit-learn中给出的解决方案?
编辑:到目前为止,我发现的唯一解决方案是使用 HashTables 亲自编写稀疏向量实现。
【问题讨论】:
-
请在此处具体发布您与收藏相关的要求。
标签: java machine-learning nlp text-classification