【问题标题】:Drill failing to read most of the columns in Parquet generated by SparkDrill 无法读取 Spark 生成的 Parquet 中的大部分列
【发布时间】:2019-07-03 12:04:17
【问题描述】:

我仅在数据节点之上以分布式模式运行 Drill 1.15(3 个节点,每个节点具有 32GB 内存)。 我正在尝试读取从 HDF 中的 Spark 作业生成的镶木地板文件。

生成的文件正在 spark 中读取,很好,但是在 Drill 中读取时,它似乎不适用于除少数列之外的列。

org.apache.drill.common.exceptions.UserRemoteException: DATA_READ 错误:从磁盘读取时发生异常。文件: [文件名].parquet 列:行组开始:111831 文件: [文件名].parquet 列:行组开始:111831 片段 0:0 [错误 ID: [主机] 上的 [Error_id]:31010]

在 dfs 的钻孔配置中,我有镶木地板格式的默认配置。

我正在尝试运行一个简单的查询:

select * from dfs.`/hdfs/path/to/parquet/file.parquet`

如果文件大小也以 10 多 MB 为单位,则不是很多。

我使用的是 Spark 2.3 版本,使用 1.15 版本的 Drill 生成 parquet 文件。

我是否缺少任何配置或其他一些问题?

【问题讨论】:

  • 这是个有趣的问题,但没有那么有价值,除非您可以提供 minimal reproducible example。
  • @user10465355 我添加了查询示例和节点信息。您是否正在寻找任何其他具体细节?我绝对可以为您提供

标签: python apache-spark hdfs parquet apache-drill


【解决方案1】:

看起来像一个错误。
请创建Jira 票证并提供file.parquet 和日志文件。
谢谢

【讨论】:

  • @Vitalli 感谢您的回复。由于数据限制,我将无法提供确切的镶木地板,但我可以尝试在另一个文件中复制相同的内容。
猜你喜欢
  • 2016-02-06
  • 1970-01-01
  • 2020-12-14
  • 2014-12-05
  • 2020-05-03
  • 1970-01-01
  • 2020-05-17
  • 2019-10-22
  • 2019-07-09
相关资源
最近更新 更多