【问题标题】:Query Orc file on s3n is crazy slow在 s3n 上查询 Orc 文件非常慢
【发布时间】:2015-11-04 06:36:00
【问题描述】:

只要我在 hdfs 上查询我的 ORC 文件,一切都很好而且非常快 - 但是当我想查询存储在 S3 上的数据时,速度非常慢并且查询无法完成。

我正在使用 Hive 0.12 我的创建语句是这样的

CREATE external TABLE externalORCFiles (... , ... , ...)
STORED AS ORC 
location 's3n://...'; 

在我看来,ORC + Presto + S3 (see here) 也存在同样的问题,但我找不到 Hive 的类似问题

【问题讨论】:

  • 有什么更新吗?我在 Hive 1.1 上面临同样的问题
  • 有人在 Amazon EMR 上使用 Presto 尝试过吗??

标签: hadoop amazon-s3 hive orc


【解决方案1】:

在冷藏方面,S3 是一个非常好的存储空间。但是它并不真正适合 HDFS 空间。 S3 数据以大约 50Mbps 的速度移动(可能或多或少,但比 HDFS 慢得多)。您可以在速度和成本之间做出选择。

【讨论】:

  • 嗨 imakarsh,感谢您的回复。没关系,读取速度没有 HDFS 快,但它真的很慢……一个 16 节点的集群花了 2 小时对纯文本文件执行查询,而对 ORC 文件的相同集群完成了大约 5%在那之后的工作......我认为问题在于,S3n - 本机文件系统。由于某些原因,Hive ORC 文件读取器的性能似乎相当糟糕
猜你喜欢
  • 2016-03-23
  • 1970-01-01
  • 2019-09-29
  • 2020-03-26
  • 1970-01-01
  • 2020-01-10
  • 2015-03-18
  • 1970-01-01
相关资源
最近更新 更多