MRS 2.0.1版本证书有效期延长补丁指导
补丁基本信息
MRS集群Manager和大数据组件证书即将过期(最晚将于2026.11.25过期),该补丁提供证书替换能力。
安装补丁前提条件
- 需要获取Manager页面登录用户名和登录密码(登录用户需要有集群的操作权限,例如admin用户)。
- 下载补丁工具至集群主oms节点补丁下载地址。
OMS节点一般为master1和master2节点,主OMS节点判断方法,执行以下命令,返回结果为active的节点为主OMS节点,返回结果为standby的节点为备OMS节点
x86架构:
su - omm -c "sh ${BIGDATA_HOME}/OMSV100R001C00x8664/workspace/ha/module/hacom/script/get_harole.sh" aarch架构:
su - omm -c "sh ${BIGDATA_HOME}/OMSV100R001C00aarch64/workspace/ha/module/hacom/script/get_harole.sh 安装补丁过程中对现行系统的影响
补丁操作过程中,需要重启Manager相关进程和集群组件。
重启Manager相关进程,会出现短暂作业提交失败和集群状态异常,影响时长1min内(不影响已运行作业),需要客户重新提交失败作业。
重启集群组件,MRS提供离线重启和滚动重启两种方式。
- 离线重启需要停服,在离线重启完成后,客户可重新提交作业。
- 滚动重启不需要停服,滚动重启期间可能会导致存量作业失败,请重启完成后重跑失败的作业。如果涉及到管理面提交作业,会出现短暂作业提交失败,影响时长1min内,需要客户重新提交失败作业。
补丁使用流程

安装补丁
- 使用root用户登录主OMS节点,将下载的补丁(MRS_2.0.1_cert_renewal_Patch_20260707.tar.gz)工具放至“/home/omm”目录下。
- 修改相应权限后,切到omm用户下,并解压补丁工具(MRS_2.0.1_cert_renewal_Patch_20260707.tar.gz)至当前目录“/home/omm”。
chown omm:wheel -R /home/omm/MRS_2.0.1_cert_renewal_Patch_20260707.tar.gz
su - omm
cd /home/omm
tar -zxf MRS_2.0.1_cert_renewal_Patch_20260707.tar.gz
- 在ips.ini中配置需要打补丁的节点IP(当前集群所有节点IP)。
cd /home/omm/MRS_2.0.1_cert_renewal_Patch_20260707
每行配置一个IP,中间不能有空行;
- 执行脚本安装补丁。
cd /home/omm/MRS_2.0.1_cert_renewal_Patch_20260707
chmod 755 ./* -R
find ./ -type f | xargs dos2unix
nohup sh install.sh upgrade &
通过tail -f nohup.out查看执行情况(如果出现"nohup : ignoring input and appending"提示,可按回车继续),返回upgrade patch success.表示执行完成。
证书更换
- 更新集群证书(使集群证书和OMS HA证书有效期延长)。
使用omm用户登录主OMS节点,执行如下命令:
sh /opt/Bigdata/om-0.0.1/security/cert/conf/replace_cert.sh Please enter cluster login account:请输入Manager页面登录用户(该用户需要有集群的操作权限,例如admin用户) Please enter password of the cluster login account:请输入Manager页面登录用户密码
- 此操作会更新OMS HA证书和集群证书,使有效期延长。
- Manager页面登录用户需要有集群的操作权限,例如admin用户。
- 日志打印“OMS HA certificate replacement completed!”表示更换OMS HA证书成功;日志打印“replace ca successful.”表示“更换集群CA证书”脚本执行完成。
- 如果执行“replace_cert.sh”脚本不支持交互式输入参数,可通过sh /opt/Bigdata/om-0.0.1/security/cert/conf/replace_cert.sh --username='xxx' --userpwd='xxx'来指定登录用户名和登录密码,此操作可能带来泄露敏感信息安全隐患,执行时需评估风险。
- 同步配置以及重启受影响的组件。
- 登录Manager集群页面,进入“服务管理 > 更多”页,单击“同步配置”选项刷新组件证书(不勾选“重启配置过期的服务或实例”)。
- 等待“同步配置”执行完成后,分别重启LdapServer、HDFS、Hive、Spark、HBase、Hue、Kafka、Yarn、Mapreduce、Tez、Storm服务,重启服务参考重启相关组件。
- 重启组件过程中,可能会误报服务不可用告警,服务启动完成后自动清除,可忽略。
- 重启涉及组件完成后,可使用omm用户登录主OMS节点,执行如下命令,获取集群证书有效期列表:
sh /opt/Bigdata/nodeagent/security/cert/conf/listAllCertificateInfo.sh ${证书即将过期告警天数阈值}
例如:
sh /opt/Bigdata/nodeagent/security/cert/conf/listAllCertificateInfo.sh 300 (获取有效期300天内过期的证书)
查看脚本运行结果,保存目录见关键字"The results are saved in"。
证书有效期全量列表保存至certs_detail.csv,不满足证书即将过期告警天数阈值列表保存至certs_alarm.csv。
- 刷新已安装客户端
- 登录Manager集群页面,选择“服务管理 > KrbServer”,进入服务详情页,单击“下载客户端”,客户端类型选择“完整客户端”,将下载的客户端放至已安装客户端的主机上。后续步骤新下载客户端目录以“/tmp/clientNew”为例。
- 使用客户端安装用户登录已安装客户端主机,执行如下命令解压客户端:
cd /tmp/clientNew
tar -xvf MRS_KrbServer_Client.tar
tar -xvf MRS_KrbServer_ClientConfig.tar
- 执行如下命令,更新已安装客户端:
cd MRS_KrbServer_ClientConfig
sh refresh_client_cert.sh refresh ${已安装客户端目录}例如:
sh refresh_client_cert.sh refresh /opt/client
- 组件更新证书。
Kafka证书替换(未单独安装Kafka客户端可跳过此步骤)
- 以Kafka客户端安装用户登录到集群内单独安装Kafka客户端所在节点,备份kafka客户端原jdk证书。如客户端安装路径为:“/opt/kafkaclient”。
mv /opt/kafkaclient/JDK/jdk/jre/lib/security/cacerts /opt/kafkaclient/JDK/jdk/jre/lib/security/cacerts.bak
“/opt/kafkaclient” 需要替换为实际路径。
- 拷贝新jdk证书到客户端,新证书为:“/opt/Bigdata/jdk1.8.*/jre/lib/security/cacerts”,如客户端安装路径为:“/opt/kafkaclient”。
cp /opt/Bigdata/jdk1.8.*/jre/lib/security/cacerts /opt/kafkaclient/JDK/jdk/jre/lib/security
- 以Kafka客户端安装用户登录到集群内单独安装Kafka客户端所在节点,备份kafka客户端原jdk证书。如客户端安装路径为:“/opt/kafkaclient”。
扩容节点安装补丁
更新完集群证书后,对于新扩容的节点,证书有效期为20年,如果需要延长证书有效期,可执行此章节。
- 将从OBS路径中下载的补丁(MRS_2.0.1_cert_renewal_Patch_20260707.tar.gz)工具放至主OMS节点的“/home/omm”目录下(如果已存在,可跳过此步骤)。
- 修改相应权限后,切到omm用户下,并解压补丁工具(MRS_2.0.1_cert_renewal_Patch_20260707.tar.gz)至当前目录(如果之前已执行,可跳过此步骤)。
chown omm:wheel -R /home/omm/MRS_2.0.1_cert_renewal_Patch_20260707.tar.gz
su - omm
cd /home/omm
tar -zxf MRS_2.0.1_cert_renewal_Patch_20260707.tar.gz
- 进入解压后的目录,在ips.ini中配置需要打补丁的节点IP(当前集群扩容节点IP),每行配置一个IP,中间不能有空行。
cd /home/omm/MRS_2.0.1_cert_renewal_Patch_20260707
- 执行脚本安装补丁。
nohup sh install.sh upgrade &
通过tail -f nohup.out查看执行情况(打印 “upgrade patch success.” 表示执行完成)。
- 在manager页面上针对新扩容节点的DataNode、NodeManager、RegionServer、Worker、Broker、Flume、MirrorMaker、Supervisor、Logviewer实例进行同步配置以及重启操作。
- 登录Manager集群页面,进入“主机管理”页,单击新扩容节点名称进入“主机详情”页。
- 依次单击上述已安装实例名称,在“实例状态”页签中选择“更多 > 同步配置”。
- 等待同步配置完成后,选择“更多 > 重启实例”。
证书回退
如果需要将集群证书恢复为更换前CA证书,可执行”证书回退”章节。
如果涉及更新完集群证书后,新下载安装客户端,此类客户端在集群CA证书回退后,需要重新下载安装。
- OMS HA证书回退。
sh /opt/Bigdata/om-0.0.1/security/cert/conf/rollbackOmsHaCert.sh
- 集群CA证书回退。
使用omm用户登录主OMS节点,执行如下命令回退集群CA证书。
sh /opt/Bigdata/om-0.0.1/security/cert/conf/rollback_ca.sh
- 回退已安装客户端证书。
如果未执行证书更换刷新客户端证书操作,可跳过此步骤。
使用客户端安装用户登录已安装客户端主机,执行如下命令回退客户端证书:
cd /tmp/clientNew/MRS_KrbServer_ClientConfig
sh refresh_client_cert.sh rollback ${已安装客户端目录}例如:
sh refresh_client_cert.sh rollback /opt/client
- 回退kafka单独安装客户端。
使用客户端安装用户登录已安装客户端主机,将备份的证书复原,如客户端安装路径为:“/opt/kafkaclient”。
mv /opt/kafkaclient/JDK/jdk/jre/lib/security/cacerts.bak /opt/kafkaclient/JDK/jdk/jre/lib/security/cacerts
“/opt/kafkaclient” 需要替换为实际路径。
重启相关组件
补丁安装完成后,需要手动重启相关大数据组件服务,使补丁生效。
提供两种重启方式,请根据业务自行选择重启方式:
- 滚动重启(推荐):影响小,耗时长。
- 离线重启:会断服,耗时短。
- 登录MRS管理控制台或Manager界面。
- 选择如下任一方式重启相关组件。
- 在MRS控制台,选择“现有集群”,单击集群名称进入集群详情页面。单击“组件管理”,选择需要重启的服务,进入服务页面。在“服务状态”页签选择“重启服务”或单击“更多”,选择“滚动重启服务”。
- 在FusionInsight Manager界面,选择“服务管理 > 待操作的服务名称”,在“服务状态”页签单击“更多”,选择“重启服务”或“滚动重启服务”。
表1 重启策略以及影响 组件名称
重启策略
影响范围
影响时间
HBase
直接重启
重启期间无法进行HBase数据读写。
直接重启耗时约5分钟。
滚动重启
重启时客户端重试连接其他节点,不影响整体服务。
滚动重启10个节点耗时约30分钟。
HDFS
直接重启
重启期间无法进行HDFS读写,影响上层组件与作业。
直接重启耗时约10分钟。
滚动重启
滚动重启不影响业务。
滚动重启10节点耗时约40分钟。
Hive
直接重启
重启期间无法运行HiveSQL。
直接重启耗时约5分钟。
滚动重启
HiveServer滚动重启时,如果仍有客户端连接到滚动重启的HiveServer上,客户端正在运行的任务将失败。
重启Hive服务期间,如果仍有客户端连接HiveServer提交任务,可能导致任务运行失败。
备注:
在”滚动重启服务 -> 高级选项”中,可以根据情况调小”退服超时时间”,以避免滚动重启长时间等待情况,例如600s
HiveServer滚动重启时,将等待客户端连接断开,最长等待时间为退服超时时间。
Hue
直接重启
重启期间Hue页面无法访问。
直接重启耗时约5分钟。
滚动重启
不支持滚动重启。
-
Kafka
直接重启
直接重启业务会中断
直接重启耗时约5分钟。
滚动重启
需要提前查看Broker各实例数据同步正常,可以参考Kafka的监控指标“未完全同步的Partition总数”进行查看。
滚动重启10个节点耗时约10分钟。
LdapServer
直接重启
重启期间影响作业提交krb认证,可能导致作业提交失败。
直接重启耗时约5分钟。
滚动重启
滚动重启不影响业务。
滚动重启耗时约10分钟。
Mapreduce
直接重启
重启期间无法访问作业历史页面查看历史任务信息,不影响作业运行。
直接重启耗时约5分钟。
滚动重启
滚动重启不影响业务。
滚动重启耗时约10分钟。
Spark
直接重启
仅影响Spark thrift任务,SparkSQL、Spark Submit任务不受影响。
直接重启耗时约5分钟。
滚动重启
滚动重启过程中,提交的任务会有小概率失败,正在运行的任务不受影响。
滚动重启2个实例约10分钟。
Storm
直接重启
重启期间Storm不对外提供服务,不能提交Storm任务。
直接重启耗时约2~3分钟。
滚动重启
滚动重启不影响业务。
滚动重启耗时约4~5分钟。
Tez
直接重启
只影响查看任务页面。
直接重启耗时约5分钟。
滚动重启
不支持滚动重启。
-
Yarn
直接重启
直接重启期间,不可新提交任务,正在运行Spark、Flink任务有重试机制不受影响。
直接重启耗时约5分钟。
滚动重启
依赖NM的 remote shuffle Spark任务受影响,Flink任务有概率失败,Hive任务有概率失败。
滚动重启10节点耗时约25分钟。
卸载补丁
当集群安装补丁失败或新扩容节点安装补丁失败,可执行此章节进行补丁卸载。
- 执行卸载脚本。
su - omm
cd /home/omm/MRS_2.0.1_cert_renewal_Patch_20260707
- 在ips.ini中配置需要卸载补丁的节点IP(当前集群所有节点IP)。
nohup sh install.sh rollback &
- 通过tail -f nohup.out查看执行情况,打印如下内容表示执行完成:
rollback patch success.