【发布时间】:2018-07-05 11:50:37
【问题描述】:
我有 2 个相同数据的实例。
- 以 parquet 格式名为 myData 的 Hive 表
- parquet 格式的 Parquet 文件(不由 Hive 管理)
考虑以下代码:
val myCoolDataSet = spark
.sql("select * from myData")
.select("col1", "col2")
.as[MyDataSet]
.filter(x => x.col1 == "Dummy")
还有这个:
val myCoolDataSet = spark
.read
.parquet("path_to_file")
.select("col1", "col2")
.as[MyDataSet]
.filter(x => x.col1 == "Dummy")
我的问题是在性能和扫描数据量方面哪个更好? spark如何为这两种不同的方法计算它?
【问题讨论】:
-
你发现不同了吗?
标签: scala apache-spark parquet