【发布时间】:2019-07-03 12:04:17
【问题描述】:
我仅在数据节点之上以分布式模式运行 Drill 1.15(3 个节点,每个节点具有 32GB 内存)。 我正在尝试读取从 HDF 中的 Spark 作业生成的镶木地板文件。
生成的文件正在 spark 中读取,很好,但是在 Drill 中读取时,它似乎不适用于除少数列之外的列。
org.apache.drill.common.exceptions.UserRemoteException: DATA_READ 错误:从磁盘读取时发生异常。文件: [文件名].parquet 列:行组开始:111831 文件: [文件名].parquet 列:行组开始:111831 片段 0:0 [错误 ID: [主机] 上的 [Error_id]:31010]
在 dfs 的钻孔配置中,我有镶木地板格式的默认配置。
我正在尝试运行一个简单的查询:
select * from dfs.`/hdfs/path/to/parquet/file.parquet`
如果文件大小也以 10 多 MB 为单位,则不是很多。
我使用的是 Spark 2.3 版本,使用 1.15 版本的 Drill 生成 parquet 文件。
我是否缺少任何配置或其他一些问题?
【问题讨论】:
-
这是个有趣的问题,但没有那么有价值,除非您可以提供 minimal reproducible example。
-
@user10465355 我添加了查询示例和节点信息。您是否正在寻找任何其他具体细节?我绝对可以为您提供
标签: python apache-spark hdfs parquet apache-drill