【问题标题】:Zeppelin : Convert a pyspark.rdd.RDD to dataframe (pyspark dataframe)Zeppelin:将 pyspark.rdd.RDD 转换为数据帧(pyspark 数据帧)
【发布时间】:2017-09-18 11:55:02
【问题描述】:

我正在尝试将 pyspark.rdd.RDD 转换为数据框。我已经在 spark 中完成了它,但现在在 Zeppelin 中它似乎并没有以同样的方式工作。

我曾经以这种方式转换我的 pyspark.rdd.RDD :

from pyspark import SparkContext, SparkConf
from pyspark.sql import SparkSession
import pandas as pd


#comment if a SparkContext has already been created   
sc = SparkContext()

conf = {"es.resource" : "index/type", "es.nodes" : "ES_Serveur", "es.port" : "9200", "es.query" : "?q=*"}
rdd = sc.newAPIHadoopRDD("org.elasticsearch.hadoop.mr.EsInputFormat","org.apache.hadoop.io.NullWritable", "org.elasticsearch.hadoop.mr.LinkedMapWritable", conf=conf)

#to allow the toDF methode
spark = SparkSession(sc)

df = rdd.toDF().toPandas()

它可以工作...在火花提交中不在 Zeppelin 中。

我想知道为什么。

我有一些日志错误,但超过 1000 行。如果你愿意,我可以给你这些日志。

如果有人有想法.. 谢谢

【问题讨论】:

    标签: python pyspark apache-zeppelin


    【解决方案1】:

    我找到了解决办法:在Spark Interpreter的配置中(Zeppelin中),你需要在false中更改zeppelin.spark.useHiveContext这一行。 然而,我不明白为什么问题出现在 toDF 方法所在的行......

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2016-01-03
      • 2021-11-16
      • 2017-01-25
      • 2021-10-29
      • 2017-11-11
      • 2021-10-06
      • 1970-01-01
      相关资源
      最近更新 更多