【发布时间】:2017-07-08 16:38:21
【问题描述】:
我正在尝试根据 NLP 的词袋模型进行分类。
- 是否使用 NLTK 对火车数据进行了预处理(标点符号、停用词删除、小写字母、词干提取等)
- 为火车创建了 tf-idf 矩阵。
- 对测试进行了预处理。
- 为测试数据创建了 tf-idf 矩阵。
- Train 和 Test 数据的词袋不同,因此特征数不同,因此我们不能使用 knn 之类的分类算法。
- 我将训练和测试数据合并在一起并创建了 tf-idf 矩阵。这样就解决了上述不同词袋的问题。但生成的矩阵太大而无法处理。
这是我的问题:
- 有没有办法为训练和测试创建准确的词袋?
- 如果没有并且我添加训练和测试的方法是正确的,我是否应该使用像 LDA 这样的降维算法?
【问题讨论】: