【问题标题】:Applying Machine learning algorithms on .libsvm format datafiles在 .libsvm 格式的数据文件上应用机器学习算法
【发布时间】:2019-02-26 11:15:57
【问题描述】:

我目前正在处理 .libsvm 格式的数据集,我无法在这些数据集上使用不同的机器学习算法,例如 kNN、SVM、随机森林。

将它们应用于 .csv 格式很容易,但该方法不适用于 .libsvm 文件。

请说明方法。

【问题讨论】:

  • libsvm 是一种低级方法,并且有一个简单的估算器。您可以将数据转换为其他格式,然后尝试使用您提到的经典算法(如 kNN、SVM、随机森林)在其上构建估算器。
  • @abunickabhi 你想说什么? libsvm 是一个库,它的 simple estimator 实际上并不那么简单,它是一个 SVM。这是 sklearn 执行(内核)SVM 所使用的库。

标签: python machine-learning libsvm


【解决方案1】:

LIBSVM 格式是公开标准化的,可以说比 csv 更易于解析/使用。基本格式可见here

但你不需要自己做。

您可以使用sklearn 阅读它们,它是load_svmlight_file

将 svmlight / libsvm 格式的数据集加载到稀疏 CSR 矩阵中

但是要让自己熟悉稀疏矩阵,尽管在使用 sklearn 时,大多数东西都可以在你不关心密集与稀疏的情况下工作。

我不太了解这种格式相对于 svmlight 格式的背景/演变,但 sklearn 的文档说这些是相同的,我可以通过经验 ob 能够加载所有 libsvm datasets 来支持这一点上面的函数。

【讨论】:

  • 感谢您的关注。我已经使用 sklearn 成功加载了数据集,但在应用机器学习算法时遇到了困难,因为通常的 pandas 函数在它上面不起作用。
猜你喜欢
  • 1970-01-01
  • 2016-11-01
  • 1970-01-01
  • 2017-12-26
  • 2013-05-04
  • 2021-05-04
  • 2011-08-01
  • 2017-06-07
  • 1970-01-01
相关资源
最近更新 更多