计算
弹性云服务器 ECS
Flexus云服务
裸金属服务器 BMS
弹性伸缩 AS
镜像服务 IMS
专属主机 DeH
函数工作流 FunctionGraph
云手机服务器 CPH
Huawei Cloud EulerOS
网络
虚拟私有云 VPC
弹性公网IP EIP
虚拟专用网络 VPN
弹性负载均衡 ELB
NAT网关 NAT
云专线 DC
VPC终端节点 VPCEP
云连接 CC
企业路由器 ER
企业交换机 ESW
全球加速 GA
安全与合规
安全技术与应用
Web应用防火墙 WAF
企业主机安全 HSS
云防火墙 CFW
安全云脑 SecMaster
DDoS防护 AAD
数据加密服务 DEW
数据库安全服务 DBSS
云堡垒机 CBH
数据安全中心 DSC
云证书管理服务 CCM
边缘安全 EdgeSec
威胁检测服务 MTD
CDN与智能边缘
内容分发网络 CDN
CloudPond云服务
智能边缘云 IEC
迁移
主机迁移服务 SMS
对象存储迁移服务 OMS
云数据迁移 CDM
迁移中心 MGC
大数据
MapReduce服务 MRS
数据湖探索 DLI
表格存储服务 CloudTable
云搜索服务 CSS
数据接入服务 DIS
数据仓库服务 GaussDB(DWS)
数据治理中心 DataArts Studio
数据可视化 DLV
数据湖工厂 DLF
湖仓构建 LakeFormation
企业应用
云桌面 Workspace
应用与数据集成平台 ROMA Connect
云解析服务 DNS
专属云
专属计算集群 DCC
IoT物联网
IoT物联网
设备接入 IoTDA
智能边缘平台 IEF
用户服务
账号中心
费用中心
成本中心
资源中心
企业管理
工单管理
国际站常见问题
ICP备案
我的凭证
支持计划
客户运营能力
合作伙伴支持计划
专业服务
区块链
区块链服务 BCS
Web3节点引擎服务 NES
解决方案
SAP
高性能计算 HPC
视频
视频直播 Live
视频点播 VOD
媒体处理 MPC
实时音视频 SparkRTC
数字内容生产线 MetaStudio
存储
对象存储服务 OBS
云硬盘 EVS
云备份 CBR
存储容灾服务 SDRS
高性能弹性文件服务 SFS Turbo
弹性文件服务 SFS
云硬盘备份 VBS
云服务器备份 CSBS
数据快递服务 DES
专属分布式存储服务 DSS
容器
云容器引擎 CCE
容器镜像服务 SWR
应用服务网格 ASM
华为云UCS
云容器实例 CCI
管理与监管
云监控服务 CES
统一身份认证服务 IAM
资源编排服务 RFS
云审计服务 CTS
标签管理服务 TMS
云日志服务 LTS
配置审计 Config
资源访问管理 RAM
消息通知服务 SMN
应用运维管理 AOM
应用性能管理 APM
组织 Organizations
优化顾问 OA
IAM 身份中心
云运维中心 COC
资源治理中心 RGC
应用身份管理服务 OneAccess
数据库
云数据库 RDS
文档数据库服务 DDS
数据管理服务 DAS
数据复制服务 DRS
云数据库 GeminiDB
云数据库 GaussDB
分布式数据库中间件 DDM
数据库和应用迁移 UGO
云数据库 TaurusDB
人工智能
人脸识别服务 FRS
图引擎服务 GES
图像识别 Image
内容审核 Moderation
文字识别 OCR
AI开发平台ModelArts
图像搜索 ImageSearch
对话机器人服务 CBS
华为HiLens
视频智能分析服务 VIAS
语音交互服务 SIS
应用中间件
分布式缓存服务 DCS
API网关 APIG
微服务引擎 CSE
分布式消息服务Kafka版
分布式消息服务RabbitMQ版
分布式消息服务RocketMQ版
多活高可用服务 MAS
事件网格 EG
企业协同
华为云会议 Meeting
云通信
消息&短信 MSGSMS
云生态
合作伙伴中心
云商店
开发者工具
SDK开发指南
API签名指南
Terraform
华为云命令行工具服务 KooCLI
其他
产品价格详情
系统权限
管理控制台
客户关联华为云合作伙伴须知
消息中心
公共问题
开发与运维
应用管理与运维平台 ServiceStage
软件开发生产线 CodeArts
需求管理 CodeArts Req
部署 CodeArts Deploy
性能测试 CodeArts PerfTest
编译构建 CodeArts Build
流水线 CodeArts Pipeline
制品仓库 CodeArts Artifact
测试计划 CodeArts TestPlan
代码检查 CodeArts Check
代码托管 CodeArts Repo
云应用引擎 CAE
开天aPaaS
云消息服务 KooMessage
云手机服务 KooPhone
云空间服务 KooDrive

运行SparkSubmit作业

更新时间:2025-01-21 GMT+08:00

用户可将自己开发的程序提交到MRS中,执行程序并获取结果,本章节指导您如何在MRS集群中提交一个SparkSubmit作业。

Spark是一个开源的并行数据处理框架,能够帮助用户简单、快速的开发,统一的大数据应用,对数据进行离线处理、流式处理、交互式分析等。

用户可以在MRS管理控制台在线创建一个作业并提交运行,也可以通过MRS集群客户端来以命令行形式提交作业。

前提条件

  • 用户已经将运行作业所需的程序包和数据文件上传至OBS系统或HDFS中。
  • 如果作业程序需要读取以及分析OBS文件系统中的数据,需要先配置MRS集群的存算分离,请参考配置MRS集群存算分离

通过管理控制台提交作业

  1. 登录MRS管理控制台。
  2. 选择“现有集群”,选中一个运行中的集群并单击集群名称,进入集群信息页面。
  3. “概览”页签的基本信息区域,单击“IAM用户同步”右侧的“同步”进行IAM用户同步。

    集群开启Kerberos认证时需执行该步骤,若集群未开启Kerberos认证,无需执行本步骤。

    说明:
    • IAM用户同步完成后,请等待5分钟,再进行提交作业,更多IAM用户同步说明请参考IAM用户同步MRS集群说明
    • 当IAM用户的用户组的所属策略从MRS ReadOnlyAccess向MRS CommonOperations、MRS FullAccess、MRS Administrator变化时,或者反之从MRS CommonOperations、MRS FullAccess、MRS Administrator向MRS ReadOnlyAccess变化时,由于集群节点的SSSD(System Security Services Daemon)缓存刷新需要时间,因此用户同步完成后,请等待5分钟,待新策略生效之后,再进行提交作业,否则会出现提交作业失败的情况。
    • 当前IAM用户名中存在空格时(例如admin 01),不支持添加作业。

  4. 单击“作业管理”,在作业列表界面单击“添加”。
  5. “作业类型”选择“SparkSubmit”,并配置其他作业信息。

    图1 添加Spark作业
    表1 作业配置信息

    参数

    描述

    示例

    作业名称

    作业名称,只能由字母、数字、中划线和下划线组成,并且长度为1~64个字符。

    spark_job

    执行程序路径

    待执行程序包地址,可直接手动输入地址路径,也可单击“HDFS”或者“OBS”选择文件。

    • 最多为1023字符,不能包含;|&>,<'$特殊字符,且不可为空或全空格。
    • OBS程序路径地址以“obs://”开头,例如“obs://wordcount/program/XXX.jar”。HDFS程序路径地址以“hdfs://”开头,例如“hdfs://hacluster/user/XXX.jar”。
    • SparkSubmit作业执行程序需要以“.jar”“.py”结尾。

    obs://wordcount/program/test.jar

    运行程序参数

    可选参数,为本次执行的作业配置相关优化参数(例如线程、内存、CPU核数等),用于优化资源使用效率,提升作业的执行性能。

    Spark作业常用的运行程序参数如表2所示,可根据执行程序及集群资源情况进行配置。

    -

    执行程序参数

    可选参数,程序执行的关键参数,该参数由用户程序内的函数指定,MRS只负责参数的传入。

    多个参数间使用空格隔开,最多为150000字符,不能包含;|&><'$特殊字符,可为空。

    注意:

    用户输入带有敏感信息(如登录密码)的参数时,可通过在参数名前添加“@”的方式为该参数值加密,以防止敏感信息被明文形式持久化。

    在MRS管理控制台查看作业信息时,敏感信息会显示为“*”。

    例如:username=testuser @password=用户密码

    -

    服务配置参数

    可选参数,用于为本次执行的作业修改服务配置参数。

    该参数的修改仅适用于本次执行的作业,如需对集群永久生效,请参考修改MRS集群组件配置参数进行集群组件配置参数的修改。

    如需添加多个参数,请单击右侧的“添加”按钮。

    例如作业需要通过AK/SK方式访问OBS,增加以下服务配置参数:

    • fs.obs.access.key:访问OBS的密钥ID。
    • fs.obs.secret.key:访问OBS与密钥ID对应的密钥。

    -

    命令参考

    用于展示提交作业时提交到后台执行的命令。

    spark-submit --master yarn--deploy-mode cluster

    表2 Spark作业运行程序参数

    参数

    描述

    示例

    --conf

    添加任务的配置项。

    spark.executor.memory=2G

    --driver-memory

    设置driver的运行内存。

    2G

    --num-executors

    设置executor启动数量。

    5

    --executor-cores

    设置executor核数。

    2

    --class

    设置任务的主类名,由用户程序内的函数指定。

    org.apache.spark.examples.SparkPi

    --files

    上传文件给作业任务,可以是自己定义的配置文件或者某些数据文件,来源可以是OBS或者HDFS。

    -

    --jars

    上传任务额外依赖的jar,通常用于给任务添加外部依赖包。

    -

    --executor-memory

    设置executor的内存。

    2G

    --conf spark-yarn.maxAppAttempts

    控制AM的重试次数。

    设置为0时,不允许重试,设置为1时,允许重试一次。

    0

    表3 作业配置信息

    参数

    参数说明

    作业名称

    作业名称,只能由字母、数字、中划线和下划线组成,并且长度为1~64个字符。

    说明:

    建议不同的作业设置不同的名称。

    执行程序路径

    待执行程序包地址,需要满足如下要求:

    • 最多为1023字符,不能包含;|&>,<'$特殊字符,且不可为空或全空格。
    • 执行程序路径可存储于HDFS或者OBS中,不同的文件系统对应的路径存在差异。
      • OBS:以“s3a://”开头。示例:s3a://wordcount/program/xxx.jar
      • HDFS:以“/user”开头。数据导入HDFS请参考上传应用数据至MRS集群
    • Spark Script需要以“.sql”结尾,MapReduce和Spark需要以“.jar”结尾。sql、jar不区分大小写。

    执行程序参数

    程序执行的关键参数,该参数由用户程序内的函数指定,MRS只负责参数的传入。多个参数间使用空格隔开。

    配置方法:包名.类名

    最多为150000字符,不能包含;|&><'$特殊字符,可为空。

    注意:

    用户输入带有敏感信息(如登录密码)的参数时,可通过在参数名前添加“@”的方式,为该参数值加密,以防止敏感信息被明文形式持久化。在MRS管理控制台查看作业信息时,敏感信息显示为“*”。

    例如:

    username=testuser @password=用户密码

    数据输入路径

    数据输入地址。

    数据可存储于HDFS或者OBS中,不同的文件系统对应的路径存在差异。

    最多为1023字符,不能包含;|&>,<'$特殊字符,可为空。

    输出路径

    数据输出地址。

    说明:
    • 配置此参数时,单击“OBS”“HDFS”,并选择文件目录,或者手动输入文件目录,然后单击“确定”
    • 若添加hadoop-mapreduce-examples-x.x.x.jar样例程序或和hadoop-mapreduce-examples-x.x.x.jar类似的程序,请手动输入一个不存在的目录。
    数据可存储于HDFS或者OBS中,不同的文件系统对应的路径存在差异。
    • OBS:以“s3a://”开头。
    • HDFS:以“/user”开头。

    最多为1023字符,不能包含;|&>,<'$特殊字符,可为空。

    日志路径

    作业日志存储地址,该日志信息记录作业运行状态。

    数据可存储于HDFS或者OBS中,不同的文件系统对应的路径存在差异。
    • OBS:以“s3a://”开头。
    • HDFS:以“/user”开头。

    最多为1023字符,不能包含;|&>,<'$特殊字符,可为空。

  6. 确认作业配置信息,单击“确定”,完成作业的新增。
  7. 作业提交成功中,可在作业列表中查看作业运行状态及执行结果,等待作业状态变为“已完成”,可查看相关程序分析结果。

通过集群客户端提交作业

  1. 安装MRS集群客户端,具体操作可参考安装MRS集群客户端

    MRS集群中默认安装了一个客户端用于作业提交,也可直接使用该客户端。MRS 3.x及之后版本客户端默认安装路径为Master节点上的“/opt/Bigdata/client”,MRS 3.x之前版本为Master节点上的“/opt/client”。

  2. 将待运行的应用程序上传到集群客户端所在节点。

    说明:
    • 本章节示例中使用的jar样例程序为“{集群客户端安装目录}/Spark2x/spark/examples/jars/spark-examples_*.jar”(部分版本集群中Spark2x文件夹名称为Spark,请以实际为准)。
    • 可登录客户端节点执行如下命令,将待运行的jar包样例上传至HDFS中。

      例如上传至HDFS的“/tmp”目录中:

      hdfs dfs -put {客户端安装目录}/Spark2x/spark/examples/jars/spark-examples_*.jar /tmp

  3. 如果当前集群已开启Kerberos认证,参考创建MRS集群用户页面,创建一个用于提交作业的用户。

    如果当前集群未开启Kerberos认证,则无需执行本步骤。

    本示例创建一个机机用户,并分配了正确的用户组(hadoop、supergroup)、主组(supergroup)和角色权限(System_administrator、default)。

    用户创建成功后,下载认证凭据文件:
    • 对于MRS 3.x及之后版本集群,请登录FusionInsight Manager页面选择“系统 > 权限 > 用户”,在新增用户的操作列单击“更多 > 下载认证凭据”
    • 对于MRS 2.x及之前版本集群,请登录MRS Manager页面选择“系统设置 > 用户管理”,在新增用户的操作列单击“更多 > 下载认证凭据”

    上传用户认证凭据到集群客户端节点的“/opt”目录下。

  4. 使用MRS集群客户端安装用户登录客户端所在的节点。
  5. 执行如下命令解压用户认证凭据文件,得到“user.keytab”和“krb5.conf”两个文件。

    cd /opt

    tar -xvf XXX_keytab.tar

  6. 执行以下命令初始化环境变量。

    cd /opt/Bigdata/client

    source bigdata_env

    cd $SPARK_HOME

  7. 执行以下命令提交Spark作业。

    ./bin/spark-submit --master yarn --deploy-mode client --conf spark.yarn.principal=MRSTest --conf spark.yarn.keytab=/opt/user.keytab --class org.apache.spark.examples.SparkPi examples/jars/spark-examples_*.jar 10

    ...
    Pi is roughly 3.1402231402231404

    参数解释:

    • deploy-mode:Spark driver的运行模式,可设置为client或者cluster,本示例中使用client模式提交该作业。
    • conf:额外的配置属性,例如本示例中使用keytab文件进行用户认证,配置以下参数:
      • spark.yarn.principal:提交作业的用户名。
      • spark.yarn.keytab:用户认证的keytab文件。
    • class:应用程序的主类名,由具体运行的应用程序指定。
    • XXX.jar:作业执行的程序。

我们使用cookie来确保您的高速浏览体验。继续浏览本站,即表示您同意我们使用cookie。 详情

文档反馈

文档反馈

意见反馈

0/500

标记内容

同时提交标记内容