一、前提

安装jdk

scala、spark版本号:
scala scala-2.11.12
spark spark-2.4.5

安装包下载地址:
https://pan.baidu.com/s/1Lq5odbQiYdSpkqbyRX8Fww)
提取码:w2xv

二、安装配置scala

1、下载并上传scala安装包至linux的software目录下

2、解压安装包至/opt目录下,并重命名为scala

tar -zxvf scala-2.11.12.tgz -C /opt/
cd /opt/
mv scala-2.11.12/ scala

在这里插入图片描述
在这里插入图片描述

3、修改环境变量

vi /etc/profile

在这里插入图片描述

//修改内容如下:
export SCALA_HOME=/opt/scala
export PATH=... :$SCALA_HOME/bin:$PATH

在这里插入图片描述
环境变量修改完成后,执行source /etc/profile

4、检测scala是否安装成功

scala -version
scala

在这里插入图片描述

三、安装配置spark

1、下载并上传scala安装包至linux的software目录下

2、解压安装包至/opt目录下,并重命名为spark

tar -zxvf spark-2.4.5-bin-hadoop2.6.tgz -C /opt/
cd /opt/
mv spark-2.4.5-bin-hadoop2.6.tgz/ spark

在这里插入图片描述
在这里插入图片描述

3、修改配置文件

  • 3.1、修改环境变量
vi /etc/profile

在这里插入图片描述

//修改内容如下:
export SPARK_HOME=/opt/spark
export PATH=... :$SPARK_HOME/bin:$PATH

在这里插入图片描述
环境变量修改完成后,执行source /etc/profile

  • 3.2、修改相关配置文件
    修改/opt/spark/conf/目录下的配置文件
    复制spark-env.sh.template文件到当前目录,并重命名为spark-env.sh
cd /opt/spark/conf/
cp spark-env.sh.template spark-env.sh

在这里插入图片描述

//修改spark-env.sh文件内容
//在文件最后添加以下内容:
export JAVA_HOME=/opt/jdk1.8.0_221
export SCALA_HOME=/opt/scala
export SPARK_HOME=/opt/spark
export SPARK_MASTER_IP=hadoop001
export SPARK_EXECUTOR_MEMORY=1G

在这里插入图片描述

4、检测spark是否安装成功

  • 方式一:本地模式
spark-shell --master local[自定义线程数]

在这里插入图片描述
注:
可以通过以下几种方式设置spark运行的线程数
(1)local:所有计算都运行在一个线程中;
(2)local[K]:指定K个线程来运行计算,通常CPU有几个Core(线程数),就指定K为几,最大化利用CPU并行计算能力;
(3)local[*]:自动设定CPU的最大Core数

  • 方式二:Standalone(单机模式)
spark-shell --master spark://hadoop001:7077

在这里插入图片描述

  • 方式三:YARN模式
spark-shell --master yarn-client

注:本文配置的是单机模式,不支持集群配置

四、测试练习

单词计数

scala> sc.parallelize(List("hello world","hello java","hello scala","hello spark"))
res2: org.apache.spark.rdd.RDD[String] = ParallelCollectionRDD[1] at parallelize at <console>:25

scala> res2.flatMap(x=>x.split(" ")).map(x=>(x,1)).reduceByKey(_+_).collect.foreach(println)

在这里插入图片描述

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐