【问题标题】:Impala not able to read full tableImpala 无法读取全表
【发布时间】:2018-09-04 04:17:09
【问题描述】:

我使用 spark-sql (v 1.6.0) 刷新了 hive 中的表,之后 impala 无法读取表的完整内容。

select * from tablename limit 10;给出了一些结果,其中 select count(*) from tablename 给出了以下错误

在文件中寻找 1073561824 时出错:hdfs://server/products/path/db/tablename/part-00017 错误(255):未知错误 255

如果我使用 where 子句执行查询也会出现同样的错误,并且所有这些查询在通过 Hive 访问时都可以正常工作。

【问题讨论】:

  • 您是否刷新了 Impala 元数据缓存?
  • 是的,我刷新了。
  • 您是否在impalad 日志服务器端找到了更多详细信息?您是否运行 Impala 目录以确保所有 impalad 守护进程的缓存同步?

标签: hive count apache-spark-sql impala


【解决方案1】:

尝试运行

invalidate metadata yourtable.

也许这可以澄清使用refreshinvalidate metadata时的区别

【讨论】:

  • 我已经使用 impala 将 tableau 连接到这些表,那么我该如何执行这个命令。
  • 不知道画面是如何工作的,请尝试发布新答案。如果您使用客户端或 hue(在 cdh 发行版中)直接连接到 impala,您应该能够运行此命令但有问题。更重要的是,这只是 impala 中的一条 sql 语句,你应该可以像任何其他查询一样运行它。
【解决方案2】:

确保您不会同时读取和写入文件 例如:读取 parquet 文件 f1,加入其他文件,然后将其写入 f1 -> 失败

【讨论】:

    猜你喜欢
    • 2019-10-28
    • 1970-01-01
    • 1970-01-01
    • 2017-10-31
    • 2015-10-20
    • 2021-10-19
    • 2018-04-21
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多