【问题标题】:Should One Use Pandas or Sklearn for Imputation/Normalization etc.? [closed]应该使用 Pandas 或 Sklearn 进行插补/归一化等吗? [关闭]
【发布时间】:2021-05-12 19:41:15
【问题描述】:

我目前正在努力让自己更熟悉 sklearn,尽管我还是 ML 的新手。在学习几个教程时,我偶然发现了我已经使用 pandas 完成的技术的 sklearn 实现。比如标准化工具、缺失值插补等。

我当前的工作流程是这样的:使用 pandas 加载和预处理数据,使用它们进行规范化、插补等,主要是在笔记本中。然后我将 csv 文件导出到一个清理过的版本,并在这个清理和处理过的数据集上以单独的 python 文件执行我的 ML 工作。这个工作流程有什么问题吗?

我真的很想从一些在该领域花费比我更多时间的人那里获得使用 pandas 进行预处理或使用 sklearn 的任何优点/缺点。也许您已经看到了一些我没有看到的障碍?

【问题讨论】:

    标签: python pandas scikit-learn


    【解决方案1】:

    在我看来,如果在进行了插补、归一化(和其他“数据清理/预处理”步骤)之后,您打算进行一些实际的机器学习,您应该使用 scikit-learn。主要优点是您可以轻松地将所有预处理步骤和最终的机器学习估计器连接到一个 Pipeline 对象中。 如果您想确保在新数据上应用与在训练数据上应用相同的步骤,这将非常方便。您的代码也将更加紧凑和可读。 如果您需要对原始数据的不同列应用不同的预处理步骤,还可以查看Column Transformers(可以包含在管道中)。

    另一方面,如果您的项目不涉及机器学习,并且您只需要预处理和清理数据以将其可视化并计算一些统计数据,您可能会决定只使用 Pandas,因此您的项目将更少依赖关系。

    【讨论】:

      猜你喜欢
      • 2017-12-27
      • 2021-12-14
      • 1970-01-01
      • 2020-07-22
      • 2021-08-21
      • 1970-01-01
      • 2011-02-16
      • 2020-05-06
      • 2015-12-19
      相关资源
      最近更新 更多