【发布时间】:2018-11-30 04:58:05
【问题描述】:
有没有办法将 Spark Df(不是 RDD)转换为 pandas DF
我尝试了以下方法:
var some_df = Seq(
("A", "no"),
("B", "yes"),
("B", "yes"),
("B", "no")
).toDF(
"user_id", "phone_number")
代码:
%pyspark
pandas_df = some_df.toPandas()
错误:
NameError: name 'some_df' is not defined
任何建议。
【问题讨论】:
-
你不用
var声明python变量 -
@user3483203 是的,我使用 Spark 和 Scala 解释器在笔记本中创建了数据框。并在尝试将 DF 转换为 pandas DF 时使用了 '%pyspark'。
-
你为什么要混合 scala 和 pyspark。只用一个
-
@RameshMaharjan 是的,我使用 scala。但我正在尝试为 Spark DF 中的列构建可视化,但我找不到相关来源。
-
什么样的可视化?
标签: pandas apache-spark apache-spark-sql