【发布时间】:2016-08-25 10:16:12
【问题描述】:
假设您正在通过 SparkContext 和 Hive 加载一个大型数据集。所以这个数据集然后分布在你的 Spark 集群中。例如,数千个变量的观察结果(值 + 时间戳)。
现在您将使用一些 map/reduce 方法或聚合来组织/分析您的数据。例如按变量名分组。
分组后,您可以将每个变量的所有观察值(值)作为时间序列数据框。如果你现在使用 DataFrame.toPandas
def myFunction(data_frame):
data_frame.toPandas()
df = sc.load....
df.groupBy('var_name').mapValues(_.toDF).map(myFunction)
- 这是否转换为每个上的 Pandas 数据帧(每个变量) 工作节点,或
- Pandas Dataframes 是否总是在驱动节点上,因此数据会从工作节点传输到驱动程序?
【问题讨论】:
标签: python hadoop pandas apache-spark pyspark