【问题标题】:AWS JupyterHub pyspark notebook to use pandas moduleAWS JupyterHub pyspark notebook 使用 pandas 模块
【发布时间】:2019-02-24 01:15:02
【问题描述】:

我有一个安装了 JupyterHub 的 docker 容器,在 AWS 集群上运行,如https://docs.aws.amazon.com/emr/latest/ReleaseGuide/emr-jupyterhub.html 所述。它有 Python 3 内核、PySpark 3、PySpark、SparkR 和 Spark 内核,并且在容器内安装了 conda 和许多其他 python 包,但没有 spark。问题是,当我运行 pyspark 或 pyspark3 内核时,它连接到 spark,安装在主节点上(在 docker 容器之外),并且所有内部模块不再可用于此笔记本(尽管它们对 python 内核可见,但在这种情况下,火花是不可见的)。

所以问题是如何使安装在 docker 中的模块对 pyspark/pyspark3 notebook 可用和可见?我认为我缺少设置中的某些内容。

我非常想在一个笔记本中使用 docker 内部安装的模块和外部安装的 spark 的方法。

到目前为止,我只能得到一个或另一个。

【问题讨论】:

    标签: amazon-web-services docker apache-spark pyspark jupyterhub


    【解决方案1】:

    我刚刚在https://blog.chezo.uno/livy-jupyter-notebook-sparkmagic-powerful-easy-notebook-for-data-scientist-a8b72345ea2dhttps://docs.microsoft.com/en-us/azure/hdinsight/spark/apache-spark-jupyter-notebook-kernels 找到了答案的一半。秘诀是在单元格中使用 %%local 魔法,它可以让我们访问安装在本地(在 docker 容器中)的 python 模块。现在我只是不知道如何保存在笔记本的“pyspark 部分”中创建的 pandas 数据框,因此它可以在“本地”部分中使用。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-04-19
      • 1970-01-01
      • 2018-04-13
      • 1970-01-01
      • 1970-01-01
      • 2018-12-02
      • 2021-06-20
      • 2019-02-13
      相关资源
      最近更新 更多