【发布时间】:2017-07-06 09:03:47
【问题描述】:
我有一个包含多个表的庞大数据集。每个表都分成数百个 csv.gz 文件,我需要通过 PySpark 将它们导入 Spark。关于如何将“csv.gz”文件导入 Spark 的任何想法? SparkSQL 中的 SparkContext 或 SparkSession 是否提供了导入此类文件的功能?
【问题讨论】:
-
sc.textFile可以工作,但它会给你一个 RDD,为你读取的每个文件提供一个分区 sicnegzip不是可拆分的压缩编解码器。
标签: csv apache-spark compression pyspark-sql gzip