【发布时间】:2019-12-09 09:11:49
【问题描述】:
我正在尝试使用以下 pyspark 代码读取托管配置单元表的 orc 文件。
spark.read.format('orc').load('hive managed table path')
当我在获取的数据帧上执行打印模式时,如下所示
root
|-- operation: integer (nullable = true)
|-- originalTransaction: long (nullable = true)
|-- bucket: integer (nullable = true)
|-- rowId: long (nullable = true)
|-- currentTransaction: long (nullable = true)
|-- row: struct (nullable = true)
| |-- col1: float (nullable = true)
| |-- col2: integer (nullable = true)
|-- partition_by_column: date (nullable = true)
现在我无法解析这些数据并对数据框进行任何操作。在应用 show() 之类的操作时,我收到一条错误消息
java.lang.IllegalArgumentException: Include vector the wrong length
有人遇到过同样的问题吗?如果是,请您建议如何解决它。
【问题讨论】:
-
select(df.row.col1)这行得通吗?在那种情况下,我猜你可以用它来压平它。 -
我试过了,df.select("row.col1").show(),得到同样的错误
标签: apache-spark hadoop hive pyspark