【发布时间】:2015-08-04 07:46:13
【问题描述】:
我正在使用 Apache-Spark,在我的项目中,我想使用 Spark-SQL。但是,我必须确定 Spark-SQL 的查询性能。我知道 Spark-SQL 不像 RDBMS 那样有效。但是我想知道 Spark-SQL 和 RDBMS 查询之间的时间差距太大吗?
例如,我正在开发具有 4 GB 内存和 1 个核心 CPU 的虚拟机。这是一个缓慢的系统。我有一个包含 2 个表的小数据集。第一个有 5M 记录,第二个有 1K 记录。当我加入两个表时,查询大约需要 60 秒。使用此硬件的 Spark-SQL 是否正常?如果我用 RDBMS 做同样的连接操作,它会花费更少的时间,但我无法在办公室用物理限制对其进行测试。
最后一个问题:如何减少 Spark-SQL 中的查询时间?
【问题讨论】:
-
我能问你为什么要使用 spark 而你只有一台机器并且只有小数据量吗??
-
@Abdulrahman,稍后我们将对大型数据集使用集群和流式操作。但是,我现在正在研究如何将 Spark 和 Spark SQL 应用于我们的应用程序。这台机器和小套装是用来研究的。
标签: apache-spark rdbms query-performance apache-spark-sql