【发布时间】:2014-09-11 12:08:46
【问题描述】:
我目前遇到在高度稀疏数据集上使用 SVM 的问题。问题是我有 N*M 数据集,其中 N 个示例和 M 个特征。 每个 N 几乎没有 10 个特征存在。
到目前为止,我将特征表示为二进制向量,即 1 如果特征存在于给定的 0 if now 中。 数据集是平衡的,我的准确率为 94%。ROC 也是 0.93。我试图理解为什么这种准确性会越来越高。
(1)谁能指导我阅读相关论文,其中稀疏数据集提供高精度,我可以尝试找到如此高准确性的原因。
(2) 我也打算使用 SciKit Learn 。谁能建议我应该在 scikit learn in SVM 中使用哪个功能,该功能专为如此高的稀疏性数据集而设计。
(3)另外,如果有人能解释一下如此高准确率背后的原因,那就太好了。
(4) 另外,如果我将二进制特征表示改为某种加权表示,是否会给我带来一些优势。
【问题讨论】:
标签: machine-learning svm sparse-matrix