【发布时间】:2020-09-24 08:26:14
【问题描述】:
这是我在 Stackoverflow 上的第一个问题。
我正在 Pyspark 中复制一个 SAS 代码库。 SAS 代码库生成并存储中间 SAS 数据集的分数(我上次统计时为 100 个),这些数据集用于交叉检查最终输出,也用于稍后的其他分析。
我的目的是以某种格式保存大量 Pyspark 数据帧,以便它们可以在单独的 Pyspark 会话中重复使用。我想到了 2 个选项:
- 将数据框保存为配置单元表。
- 将它们保存为镶木地板文件。
还有其他格式吗?哪种方法更快? parquet 文件或 csv 文件在将文件作为 Pyspark 数据帧重新读取时是否会出现与架构相关的问题?
【问题讨论】:
标签: hadoop pyspark hive sas parquet