【问题标题】:Reading partitioned parquet file into Spark results in fields in incorrect order将分区 parquet 文件读入 Spark 会导致字段顺序不正确
【发布时间】:2015-04-28 09:19:30
【问题描述】:

对于带有

的表
create table mytable (

  ..
) 
    partitioned by (my_part_column String)

我们正在执行一个hive sql如下:

   from pyspark.sql import HiveContext
   hc = HiveContext(sc)
   data = hc.sql("select * from my_table limit 10")

读回的值将“my_part_columns”显示为每一行的第一个项目,而不是最后一个。

【问题讨论】:

    标签: hive apache-spark parquet


    【解决方案1】:

    原来这是 spark 1.3.0 和 1.2.1 中修复的已知错误

    https://issues.apache.org/jira/browse/SPARK-5049

    【讨论】:

      猜你喜欢
      • 2016-02-06
      • 2018-10-04
      • 2016-07-29
      • 2017-12-02
      • 2020-12-25
      • 1970-01-01
      • 1970-01-01
      • 2022-01-20
      • 2016-10-04
      相关资源
      最近更新 更多