【发布时间】:2015-08-22 01:22:55
【问题描述】:
我从 twitter 收集数据并将其存储在 hdfs 上。我想把这些推文按照时间戳排序,但是这个查询需要很多时间。
1.5 GB 数据排序需要 1 分钟,我认为这比预期的要多得多。
可以做些什么来加快这个查询的速度?
感谢您的帮助。
【问题讨论】:
我从 twitter 收集数据并将其存储在 hdfs 上。我想把这些推文按照时间戳排序,但是这个查询需要很多时间。
1.5 GB 数据排序需要 1 分钟,我认为这比预期的要多得多。
可以做些什么来加快这个查询的速度?
感谢您的帮助。
【问题讨论】:
您不能指望 Hive 提供更快的速度。在我们的 Prod 集群上,涉及批处理作业的 MapReduce DAG 的查询的典型开销是 20 秒——这是使用精益和平均的 JDBC 连接;使用 Hive CLI 还有另外 20 秒来启动 JVM 和预热 TEZ 容器。
如果您需要关系 DBMS 的响应时间,只需使用 MySQL。或者可能是一个分布式的东西,比如免费版的 MemSQL。
【讨论】: