【发布时间】:2020-06-29 11:55:18
【问题描述】:
我正在提取不同源文件的信息。每个源文件对应于一些测量数据的给定快照时间。我有一个预处理函数,它采用其中一个文件并输出一个熊猫数据框。所以我做了一个 sparksc.wholeTextFiles 调用,它给了我所有输入文件的列表,然后我在上面调用了map,它为我提供了一个 rdd,其中每个元素都是一个 pandas 数据框。现在“重塑”这种结构的最佳方法是什么,以便我只有一个由连接的较小数据帧组成的结果数据帧?
【问题讨论】:
标签: apache-spark pyspark