【问题标题】:Read RC File pyspark 2.0.0 from S3 with partitions从带有分区的 S3 读取 RC 文件 pyspark 2.0.0
【发布时间】:2023-03-29 06:27:01
【问题描述】:

有没有一种方法可以将存储在 S3 中的 RC 文件加载到 pyspark Dataframe 2.0.0 中

【问题讨论】:

  • 这是一种用于存储数据的列式文件格式。与 csv 格式相比表现更好

标签: apache-spark amazon-s3 pyspark spark-dataframe rc


【解决方案1】:

我找到了一种将 RCFiles(从 s3)加载到 pyspark 的方法。

from pyspark.sql import HiveContext
spark = SparkSession.builder.master("yarn").appName("elevateDailyJob").enableHiveSupport().getOrCreate()
sc = spark.sparkContext
sqlContext = HiveContext(sc)
sqlContext.sql("CREATE EXTERNAL TABLE table1(col1 string,col2 string,col3 string,)PARTITIONED BY (DAYSERIAL_NUMERIC string) STORED AS RCFILE LOCATION 's3://my-databucket/my_file_rc/'")
df = sqlContext.sql("select * from table1")

以上可以使用 spark-submit 运行。 注意:您需要在病房上启用对 EMR 版本 5.x 的 hivesupport(就像我在代码的第二行中所做的那样。

【讨论】:

    猜你喜欢
    • 2018-07-17
    • 1970-01-01
    • 2018-08-19
    • 1970-01-01
    • 2021-01-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-11-07
    相关资源
    最近更新 更多