【问题标题】:Support Vector Machine on Highly Sparse Dataset高度稀疏数据集上的支持向量机
【发布时间】:2014-09-11 12:08:46
【问题描述】:

我目前遇到在高度稀疏数据集上使用 SVM 的问题。问题是我有 N*M 数据集,其中 N 个示例和 M 个特征。 每个 N 几乎没有 10 个特征存在

到目前为止,我将特征表示为二进制向量,即 1 如果特征存在于给定的 0 if now 中。 数据集是平衡的,我的准确率为 94%。ROC 也是 0.93。我试图理解为什么这种准确性会越来越高。

(1)谁能指导我阅读相关论文,其中稀疏数据集提供高精度,我可以尝试找到如此高准确性的原因。

(2) 我也打算使用 SciKit Learn 。谁能建议我应该在 scikit learn in SVM 中使用哪个功能,该功能专为如此高的稀疏性数据集而设计。

(3)另外,如果有人能解释一下如此高准确率背后的原因,那就太好了。

(4) 另外,如果我将二进制特征表示改为某种加权表示,是否会给我带来一些优势。

【问题讨论】:

    标签: machine-learning svm sparse-matrix


    【解决方案1】:

    嗯,对于初学者来说,稀疏的训练数据并不一定意味着分类准确度一定很低。如果你能找到一个好的决策边界,那么数据是否稀疏也没关系。请记住,支持向量本身是数据的一个非常小的(= 稀疏)子集,但它们仍然足以用于分类目的。与机器学习的情况一样,算法结果高度依赖于问题域和所选择的参数。

    对于您的第二个问题,“svm 稀疏数据”的第一个谷歌结果显示了这个链接: http://scikit-learn.org/stable/modules/svm.html

    至于第四个问题,你只有尝试过才能知道答案,没有人知道你的方法和相关数据的更多细节,就无法预测结果。

    【讨论】:

      猜你喜欢
      • 2012-12-08
      • 2015-10-09
      • 2013-02-16
      • 2020-03-14
      • 2019-12-27
      • 2018-12-25
      • 2011-04-02
      • 2013-07-28
      • 2020-05-22
      相关资源
      最近更新 更多