【发布时间】:2021-05-12 19:41:15
【问题描述】:
我目前正在努力让自己更熟悉 sklearn,尽管我还是 ML 的新手。在学习几个教程时,我偶然发现了我已经使用 pandas 完成的技术的 sklearn 实现。比如标准化工具、缺失值插补等。
我当前的工作流程是这样的:使用 pandas 加载和预处理数据,使用它们进行规范化、插补等,主要是在笔记本中。然后我将 csv 文件导出到一个清理过的版本,并在这个清理和处理过的数据集上以单独的 python 文件执行我的 ML 工作。这个工作流程有什么问题吗?
我真的很想从一些在该领域花费比我更多时间的人那里获得使用 pandas 进行预处理或使用 sklearn 的任何优点/缺点。也许您已经看到了一些我没有看到的障碍?
【问题讨论】:
标签: python pandas scikit-learn