【发布时间】:2016-08-13 13:52:01
【问题描述】:
我只是想进一步了解 Spark。所以想问这个问题。
我的本地计算机上当前安装了 Spark。它是 16GB 的马赫数。
我已经连接了一个运行 Pyspark 的 Jupyter 笔记本。
所以现在当我在该笔记本中进行任何编码时,例如读取数据并将数据转换为 Spark DataFrame,我想检查一下:
1)。所有数据集都分布在本地机器上。就像它使用不同的 CPU 内核等分配数据集一样吗?有没有办法找出来?
2)。仅使用没有 spark 的 Jupyter notebook 运行代码和计算与使用 Pyspark 运行 Jupyter notebook 不同吗?就像第一个只使用机器的一个内核并使用一个线程运行,而带有 Pyspark 的 Jupyter 笔记本在具有多线程/处理的 CPU 的不同内核上运行代码和计算?这种理解正确吗?
有没有办法检查这些。
谢谢
【问题讨论】:
标签: python apache-spark ipython