【发布时间】:2019-04-18 09:32:15
【问题描述】:
我想对 csv 中的数据集执行决策树回归。我需要使用 RDD 来完成。我尝试了以下方法将数据帧转换为 RDD:
pp_df = spark.read.csv("/usr/local/spark/data/hour.csv",header=True,inferSchema=True)
pp_df = pp_df.rdd.map(lambda x: LabeledPoint(x[10], x[:10])).collect()
然后我尝试拆分数据进行训练和测试:
(trainingData, testData) = pp_df.randomSplit([0.7, 0.3])
我收到以下错误:
AttributeError: 'list' object has no attribute 'randomSplit'
为什么它返回一个列表而不是我如何正确地将 csv 转换为 RDD 标记数据?
【问题讨论】:
-
在你提到 RDD(弹性分布式数据集)的标题中,后来你提到了 RRD(循环数据库)。我知道你可能是指 RDD,因为火花使用,但请保持一致..