在历经千辛万苦后,终于把所有的东西都配置好了。

下面开始介绍pyspark的一些基础内容,以字数统计为例。

1)在本地运行pyspark程序

读取本地文件

textFile=sc.textFile("file:/usr/local/spark/README.md")

textFile.count()

读取HDFS文件

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

2)在Hadoop YARN运行pyspark

HADOOP_CONF_DIR=/usr/local/hadoop/etc/hadoop pyspark --master yarn --deploy-more client

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

3)构建Spark Standalone Cluster运行环境

cp /usr/local/spark/conf/spark-env.sh.template /usr/local/spark/conf/spark-env.sh

sudo gedit /usr/local/spark/conf/spark

然后进行下面的设置

export SPARK_MASTER_IP=master

export SPARK_WORKER_CORES=1

export SPARK_WORKER_MEMORY=512m

export SPARK_WORKER_INSTANCES=4

然后连接每个计算机,之后启动Spark Standalone Cluster

/usr/local/spark/sbin/start-all.sh

pyspark --master spark://master:7077 --num-executors 1 --total-executor-cores 3 --executor 512m

读取本地文件

textFile=sc.textFile("file:/usr/local/spark/README.md")

textFile.count()

读取HDFS文件

textFile=sc.textFile('hdfs://master:9000/user/*********/wordcount/input/LICENSE.txt")

textFile.count()

相关文章:

  • 2021-07-06
  • 2021-07-04
  • 2021-09-26
  • 2021-10-22
  • 2021-11-15
  • 2020-05-19
  • 2021-11-07
猜你喜欢
  • 2020-04-09
  • 2021-11-14
  • 2021-08-21
  • 2021-08-29
  • 2022-01-01
  • 2021-04-06
  • 2018-10-16
  • 2021-09-16
相关资源
相似解决方案