【Spark】(一)spark安装配置
·
一、前提
安装jdk
scala、spark版本号:
scala scala-2.11.12
spark spark-2.4.5
安装包下载地址:
https://pan.baidu.com/s/1Lq5odbQiYdSpkqbyRX8Fww)
提取码:w2xv
二、安装配置scala
1、下载并上传scala安装包至linux的software目录下
2、解压安装包至/opt目录下,并重命名为scala
tar -zxvf scala-2.11.12.tgz -C /opt/
cd /opt/
mv scala-2.11.12/ scala


3、修改环境变量
vi /etc/profile

//修改内容如下:
export SCALA_HOME=/opt/scala
export PATH=... :$SCALA_HOME/bin:$PATH

环境变量修改完成后,执行source /etc/profile
4、检测scala是否安装成功
scala -version
scala

三、安装配置spark
1、下载并上传scala安装包至linux的software目录下
2、解压安装包至/opt目录下,并重命名为spark
tar -zxvf spark-2.4.5-bin-hadoop2.6.tgz -C /opt/
cd /opt/
mv spark-2.4.5-bin-hadoop2.6.tgz/ spark


3、修改配置文件
- 3.1、修改环境变量
vi /etc/profile

//修改内容如下:
export SPARK_HOME=/opt/spark
export PATH=... :$SPARK_HOME/bin:$PATH

环境变量修改完成后,执行source /etc/profile
- 3.2、修改相关配置文件
修改/opt/spark/conf/目录下的配置文件
复制spark-env.sh.template文件到当前目录,并重命名为spark-env.sh
cd /opt/spark/conf/
cp spark-env.sh.template spark-env.sh

//修改spark-env.sh文件内容
//在文件最后添加以下内容:
export JAVA_HOME=/opt/jdk1.8.0_221
export SCALA_HOME=/opt/scala
export SPARK_HOME=/opt/spark
export SPARK_MASTER_IP=hadoop001
export SPARK_EXECUTOR_MEMORY=1G

4、检测spark是否安装成功
- 方式一:本地模式
spark-shell --master local[自定义线程数]

注:
可以通过以下几种方式设置spark运行的线程数
(1)local:所有计算都运行在一个线程中;
(2)local[K]:指定K个线程来运行计算,通常CPU有几个Core(线程数),就指定K为几,最大化利用CPU并行计算能力;
(3)local[*]:自动设定CPU的最大Core数
- 方式二:Standalone(单机模式)
spark-shell --master spark://hadoop001:7077

- 方式三:YARN模式
spark-shell --master yarn-client
注:本文配置的是单机模式,不支持集群配置
四、测试练习
单词计数
scala> sc.parallelize(List("hello world","hello java","hello scala","hello spark"))
res2: org.apache.spark.rdd.RDD[String] = ParallelCollectionRDD[1] at parallelize at <console>:25
scala> res2.flatMap(x=>x.split(" ")).map(x=>(x,1)).reduceByKey(_+_).collect.foreach(println)

更多推荐
所有评论(0)