【发布时间】:2020-03-28 14:07:04
【问题描述】:
我正在使用 Spark 和 Pandas 解压缩 snappy.parquet 文件。我有 180 个文件(我的 Jupyter 笔记本中有 7GB 的数据)。据我了解,我需要创建一个循环来获取所有文件 - 用 Spark 解压缩它们并附加到 Pandas 表?这是代码
findspark.init()
import pyspark
from pyspark.sql import SparkSession
spark = SparkSession.builder.getOrCreate()
parquetFile = spark.read.parquet("file_name.snappy.parquet")
parquetFile.createOrReplaceTempView("parquetFile")
file_output = spark.sql("SELECT * FROM parquetFile")
file_output.show()
pandas_df = file_output.select("*").toPandas()
这部分有效,我从一个文件中获得了我的 Pandas 数据框,我还有另外 180 个文件需要附加到 pandas_df。谁能帮我吗?谢谢!
【问题讨论】:
标签: pandas apache-spark parquet snappy