Spark 上下文:
从 Spark 1.x 开始,Spark SparkContext 是 Spark 的入口点,并在 org.阿帕奇。 spark 包,用于以编程方式在集群上创建 Spark RDD、累加器和广播变量。它的对象 sc 是 spark-shell 中可用的默认变量,可以使用 SparkContext 类以编程方式创建。
SparkContext 是 spark 执行环境的客户端。
SparkContext 是 spark 执行作业的入口点。
SparkContext 充当 spark 应用程序的主人。
希望您会发现这个Apache SparkContext Examples 网站有用。
SparkSession:
自 Spark 2.0 以来,SparkSession 已成为 Spark 使用 RDD、DataFrame 和 Dataset 的入口点。在 2.0 之前,SparkContext 曾经是一个入口点。在这里,我将主要通过定义和描述如何创建 Spark Session 以及使用 spark-shell 中的默认 Spark Session 'spark' 变量来解释什么是 SparkSession。
Apache spark2.0 以后,spark session 是 spark 应用的新入口。
spark 上下文提供的所有功能都在 Spark 会话中可用。
spark session 提供用于处理数据集和数据帧的 API。
Spark2.0 之前:
Spark Context 是 Spark 作业的入口点。
RDD 是当时的主要 API 之一,它是使用 spark Context 创建和操作的。
对于其他所有 API,需要不同的上下文 - 对于 SQL,需要 SQL 上下文。
您可以在Apache SparkSession 上找到更多实时示例。
SQLContext:
在 Spark 1.0 版中,SQLContext (org.apache.spark.sql.SQLContext) 是 SQL 的入口点,以便处理结构化数据(行和列),但是 2.0 版的 SQLContext 已被 SparkSession 取代。
Apache Spark SQLContext 是 SparkSQL 的入口点,它是 Spark 1.x 中结构化数据(行和列)的 Spark 模块。加工。
Spark SQLContext 已初始化。
apache-spark SQL 上下文是 Spark SQL 的入口点,可以从 spark 上下文中接收
JavaSparkContext:
JavaSparkContext For JAVARDD 与上述相同,但在 java 实现中。
JavaSparkContext Java 友好版本的 [[org.apache.spark.SparkContext]] 返回 [[org.apache.spark.api.java.JavaRDD]] 并使用 Java 集合而不是 Scala 集合。