【发布时间】:2015-07-13 22:46:07
【问题描述】:
我在 scikit-learn 网站上读到,当维度数大于样本数时,SVM 是一个不错的选择。
我想知道你认为(作为有经验的用户)在这些要预测的类是二元的情况下更有效。
尤其是标注样本数在 50 左右时该怎么做。
应该工作的算法?需要关心的事情?
【问题讨论】:
-
当样本数量那么少时,我怀疑你能从中学到什么。
-
是的,我就是这么想的,样本数那么少怎么办?也许每次已知新样本时会更准确?
-
什么是维度?如果你对线性模型没问题,那么像 l1 惩罚 SVM 这样的稀疏线性模型可能会很好。
-
@AndreasMueller 对于每一行 (~50) 我有数千个数值。目标是二进制(0 或 1)。我想我必须做一些降维,因为我有两个很多特征。我也想知道标志列,如果我添加它们会有所帮助。
-
我的错,我没有数千个特征,只有 100 个。我认为最好是预测。
标签: machine-learning scikit-learn svm data-mining prediction