[大数据] spark on yarn配置

开发: C++知识库 Java知识库 JavaScript Python PHP知识库人工智能区块链大数据移动开发嵌入式开发工具数据结构与算法开发测试游戏开发网络协议系统运维
教程: HTML教程 CSS教程 JavaScript教程 Go语言教程 JQuery教程 VUE教程 VUE3教程 Bootstrap教程 SQL数据库教程 C语言教程 C++教程 Java教程 Python教程 Python3教程 C#教程
数码: 电脑笔记本显卡显示器固态硬盘硬盘耳机手机 iphone vivo oppo 小米华为单反装机图拉丁

-> 大数据 -> spark on yarn配置 -> 正文阅读

[大数据]spark on yarn配置

在安装好spark后

修改spark-env.sh 若没有将模板文件改名为此名称

在spark安装目录下的conf找到spark-env.sh
添加HADOOP_HOME和HADOOP_CONF_DIR让其加载yarn-site.xml文件配置
在这里插入图片描述

修改spark-defaults.conf

同在conf文件夹下找到spark-defaults.conf.template文件改名spark-defaults.conf
添加如下
在这里插入图片描述

然后将spark安装目录下的jars中的文件 put到hdfs上图所指定位置
在这里插入图片描述

hdfs dfs -put ./jars/* /spark/jars/

这样做的目的是spark运行时可以在hdfs加载需要的jar包，就像java连接数据库要用到java-connecter-mysql.jar。

spark on yarn 任务提交格式

#当前目录
#/export/servers/spark-2.2.3/
spark-submit \
--class org.apache.spark.examples.SparkPi \
--master yarn --deploy-mode client \
--conf spark.driver.host=192.168.88.12 \
examples/jars/spark-examples_2.11-2.2.3.jar 10

–class 是全限定类名
–master yarn 是指使用yarn管理
–deploy-mode client*cluster* client可以在提交任务的机器查看结果
cluster只能在yarn上看结果
–conf spark.driver.host=192.168.88.12 driver监听的主机名或者IP地址。就是提交任务机器的地址，这用于和executors以及独立的master通信接收结果
examples/jars/spark-examples_2.11-2.2.3.jar 运行的jar包
当我们测试一个demo如下图会为spark任务自动机器CPU、内存等资源
在这里插入图片描述
关于yarn-site.xml配置