【发布时间】:2017-04-25 21:10:45
【问题描述】:
我是Spark 的新手,我正在尝试访问Hive 表到Spark
1) 创建 Spark 上下文
val hc=new HiveContext(sc)
val hivetable= hc.sql("Select * from test_db.Table")
我的问题是我将表格放入 Spark。
1) 为什么我们需要注册表格?
2) 我们可以直接执行SQL operations 仍然为什么我们需要Dataframe 函数
喜欢Join, Select, Filter...等?
SQL Query` 和 Dataframe 操作之间的操作有何不同
3) 什么是 Spark 优化?它是如何工作的?
【问题讨论】:
标签: apache-spark-sql spark-dataframe