【发布时间】:2018-08-03 00:27:35
【问题描述】:
执行探索性数据分析是任何机器学习项目的第一步,我主要使用 pandas 使用适合内存的数据集执行数据探索......但我想知道如何执行数据清理、处理丢失的数据和数据异常值、单变量图、特征如何影响标签、相关性等的密度图
Pandas 使用 Python 进行数据分析既简单又直观。但是由于系统内存有限,我发现在 Pandas 中处理多个更大的数据帧很困难。
对于大于 RAM 大小的数据集...100 GB
我看过一些教程,他们使用 spark 根据规则进行过滤并生成适合内存的数据帧......最终总会有数据完全驻留在内存中,但我想知道如何处理大数据集并进行探索性数据分析
另一个挑战是可视化大数据以进行探索性数据分析......如果它适合内存,使用 seaborn 或 matplotlib 等软件包很容易做到,但如何为大数据执行它
【问题讨论】:
-
是的,dask 可以做这些事情,spark 也可以。那么你到底想做什么,你尝试了什么,问题出在哪里?你试过教程吗?
-
我在工作中的大多数项目和我在培训期间尝试过的教程都没有这么大规模的数据......曾经我使用了 35gigs 的数据,但是当我使用 spark 过滤它时,它适合内存,所以我只是使用了教程的做事方式...现在我需要重新学习自己的技能,但找不到有用的信息,而且事情太多了,如果您能指出一些参考代码或教程并根据我的需要进行调整,我将非常感谢...
-
感谢它真的很有帮助
-
@mdurant 你能否指点一些教程,让我们可视化不适合内存并使用 Dask 争论的大型数据集
标签: pyspark data-visualization plotly dask holoviews