【问题标题】:SVM modeling with BIG DATA使用 BIG DATA 进行 SVM 建模
【发布时间】:2012-10-19 12:12:47
【问题描述】:

为了在 R 中使用 SVM 进行建模,我使用了带有 Windows Xp 操作系统和 2 GB RAM 的 kernlab 包(ksvm 方法)。但是有更多的数据行如 201497,我无法为数据建模的处理提供更多内存(问题:无法分配大于 2.7 GB 的向量大小)。

因此,我使用 Amazon 微型和大型实例进行 SCM 建模。但是,它和本地机器有同样的问题(不能分配大于 2.7 GB 的向量大小)。

谁能建议我用 BIG DATA 建模解决这个问题,或者这有什么问题吗?

【问题讨论】:

  • 您的数据有多大?如果系统尝试为您的数据分配 2.7GB 或与您的数据关联的增强结构,而您只有 2GB 的物理 RAM,这将无法正常工作。
  • 这可能也有用numbertheory.nl/2012/08/15/…

标签: r svm bigdata


【解决方案1】:

如果没有可重现的示例,很难说数据集是否太大,或者脚本的某些部分是否欠佳。一些通用的指针:

  • 查看High Performance Computing Taskview,它列出了与使用 BigData 相关的主要 R 包。
  • 您使用整个数据集来训练您的模型。您可以尝试获取一个子集(例如 10%)并在其上拟合您的模型。重复此过程几次可以深入了解模型拟合是否对您使用的数据子集敏感。
  • 一些分析技术,例如PCA 分析可以通过迭代处理数据来完成,即以块的形式。这使得对非常大的数据集(>> 100 gb)的分析成为可能。我不确定kernlab 是否可以做到这一点。
  • 检查您使用的 R 版本是否为 64 位。
  • This earlier question 可能会感兴趣。

【讨论】:

    猜你喜欢
    • 2016-12-01
    • 2014-05-10
    • 2019-07-01
    • 2018-09-22
    • 2021-07-16
    • 2020-11-05
    • 2018-01-08
    • 2016-03-13
    • 2013-07-16
    相关资源
    最近更新 更多