
# 查看MRS集群事件
在MRS集群的日常运维中，管理员需要及时了解集群运行状态的变化，以便对潜在问题进行预防和排查。MRS集群中的事件是系统运行中发生的状态变化或操作记录的审计追踪，例如组件实例的启动、停止、主备倒换，以及节点慢盘隔离变化等。与告警不同，事件本身并不一定表示系统异常，但重要及以上级别的事件需要管理员关注相关组件是否运行正常。通过查看集群事件，管理员可以掌握集群的运行轨迹，及时发现潜在风险并采取预防措施。
MRS集群内常见的事件请参考[表2]。
通常来说，事件并不需要人工处理，但**重要及以上级别的事件，需要用户关注相关的组件是否运行正常、是否存在相关的告警** 并进行处理，请参考[查看MRS集群告警](https://support.huaweicloud.com/usermanual-mrs/zh-cn_topic_0040980162.html)。
#### 相关概念
- **事件与告警的区别：** 事件是系统运行中发生的所有状态变化和操作记录，用于审计和追踪系统行为；告警是系统检测到异常情况后产生的通知，需要管理员处理。事件不一定需要人工处理，但重要及以上级别的事件需关注是否伴随产生告警。
- **IAM用户同步：** MRS集群在管理控制台操作时，需要将IAM（Identity and Access Management，统一身份认证服务）中的用户信息同步到集群内部，以确保用户权限的一致性。在管理控制台查看集群事件前，需先执行IAM用户同步操作。
 
#### 操作视频
本视频将分别为您介绍查看告警和事件信息及配置告警阈值的操作。
因不同版本操作界面可能存在差异，相关视频供参考，具体以实际环境为准。
<video controls="controls" preload="none" id="zh-cn_topic_0040980162_object10893407343" class="idp-external-video" src="https://res-video.hc-cdn.com/cloudbu-site/china/zh-cn/support/mrs-video/1653988155331960649.mp4" title="告警与事件管理" poster="https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000002351240693.jpg" height="300.0000" width="600.0000"></video>
#### 通过管理控制台查看集群事件
1. 登录[MRS管理控制台](https://console.huaweicloud.com/mrs/)。
2. 选择"现有集群"，选中一个待操作的运行中的集群并单击集群名称，进入集群概览信息页面。
3. 在集群详情页的"概览"页签，单击"IAM用户同步"右侧的"同步"进行IAM用户同步**。**
   
   IAM用户同步用于将华为云统一身份认证服务中的用户信息同步到集群内部，确保控制台操作的权限一致性。
   
   
4. 选择"告警管理 \> 事件"查看当前集群的事件信息。 
   图1查看MRS集群事件   
   ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000002345328029.png "点击放大")
   在告警事件列表中，可查看当前集群已产生的事件，包含事件名称、级别以及生成时间等信息。
   单击事件名称前的箭头，可展开事件详情。
   
   
5. 如需导出当前事件信息，可单击"导出"，选择对应的导出文件格式后，导出事件文件到本地。 
   在事件页面中，确认事件列表是否正常加载并显示事件信息。检查事件级别、生成时间等字段是否正确展示。可尝试单击事件名称前的箭头展开详情，确认详情信息完整可读。
   
   
 
#### 通过Manager查看集群事件
1. 登录MRS集群Manager界面。 
   登录集群Manager界面请参考[访问MRS集群Manager](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0128.html)。
   
   
2. 选择"运维 \> 告警 \> 事件"，进入事件界面，用户可以查看集群中所有事件信息，包括名称、ID、级别、产生时间、对象、定位信息等，每页默认显示最近的十条事件。 
   - MRS 2.x及之前版本的集群，选择"告警管理 \> 事件"。
   
   - 单击"导出全部"可导出全部事件详情。
   
   - 单击![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000002293368649.png)手动刷新当前页面，也可在![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000002293481693.png)修改事件表格显示的列。
   
   - 支持通过指定对象或集群来筛选指定的事件。
   
   - 单击"高级搜索"显示事件搜索区域，搜索条件包括事件ID、事件名称、事件级别、开始时间和结束时间。
   
   
   单击指定事件名称左侧的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001933797858.png)，展开完整信息参数，各项说明如[表1]所示。
    表1事件参数 
   | 事件参数 | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                               |
   |:---|:---|
   | 事件ID | 事件信息的ID。                                                                                                                                                                                                                                                                                                                                                                                                                                         |
   | 事件名称 | 事件信息的名称。                                                                                                                                                                                                                                                                                                                                                                                                                                         |
   | 事件级别 | 事件级别。分为紧急、重要、次要、提示四个级别。 - 紧急：表示系统出现严重故障，需立即处理。  - 重要：表示系统出现较严重问题，需尽快处理。  - 次要：表示系统出现一般问题，需关注。  - 提示：表示仅用于信息展示，标识事件的发生。   |
   | 产生时间 | 事件产生的时间，格式为yyyy-MM-dd HH:mm:ss。                                                                                                                                                                                                                                                                                                                                                                                                                  |
   | 对象   | 事件关联的对象信息，如服务名称、角色名称等。                                                                                                                                                                                                                                                                                                                                                                                                                           |
   | 序列号  | 系统产生的事件计数，用于事件的唯一追踪。                                                                                                                                                                                                                                                                                                                                                                                                                             |
   | 定位信息 | 定位事件的详细信息。主要包含以下信息： - 来源：产生事件的集群名称  - 服务名：产生事件的服务名称  - 角色名：产生事件的角色名称  - 主机名：产生事件的主机名                                        |
   | 附加信息 | 事件相关的补充报错信息，用于辅助问题定位。                                                                                                                                                                                                                                                                                                                                                                                                                            |
   | 事件原因 | 事件可能的原因提示，帮助管理员理解事件发生的原因。                                                                                                                                                                                                                                                                                                                                                                                                                        |
   | 来源   | 产生事件的集群名称。                                                                                                                                                                                                                                                                                                                                                                                                                                       |
      
   
   
 
#### MRS集群常见事件列表
 表2MRS集群事件列表 
| 事件ID  | 组件         | 事件名称                        | 事件级别 |
|:---|:---|:---|:---|
| 12019 | Manager    | 停止服务                        | 提示   |
| 12021 | Manager    | 停止实例                        | 提示   |
| 12023 | Manager    | 删除节点                        | 提示   |
| 12024 | Manager    | 重启服务                        | 提示   |
| 12025 | Manager    | 重启实例                        | 提示   |
| 12026 | Manager    | Manager主备倒换                 | 次要   |
| 12065 | Manager    | 进程重新启动                      | 次要   |
| 12070 | Manager    | 作业执行成功                      | 提示   |
| 12071 | Manager    | 作业执行失败                      | 提示   |
| 12072 | Manager    | 作业被终止                       | 提示   |
| 12082 | Manager    | 慢盘自动隔离中止                    | 重要   |
| 12083 | Manager    | 慢盘隔离成功                      | 重要   |
| 12084 | Manager    | 慢盘数据均衡失败                    | 重要   |
| 12085 | Manager    | 慢盘隔离恢复                      | 重要   |
| 12086 | Manager    | Agent进程重启                   | 提示   |
| 12087 | Manager    | 慢盘取消隔离失败                    | 重要   |
| 12088 | Manager    | 慢盘取消隔离成功                    | 重要   |
| 12089 | Manager    | 慢盘隔离失败                      | 重要   |
| 12090 | Manager    | 慢盘节点隔离成功                    | 重要   |
| 12091 | Manager    | 慢盘节点取消隔离成功                  | 重要   |
| 12092 | Manager    | 慢盘节点实例启动成功                  | 重要   |
| 12093 | Manager    | 慢盘节点隔离失败                    | 重要   |
| 12094 | Manager    | 慢盘节点实例启动失败                  | 重要   |
| 12095 | Manager    | 慢盘节点取消隔离失败                  | 重要   |
| 12096 | Manager    | 慢盘节点已恢复                     | 重要   |
| 12097 | Manager    | 连接OMS节点网络异常                 | 重要   |
| 12152 | Manager    | 启动周期性复制                     | 次要   |
| 12153 | Manager    | 周期性复制完成                     | 次要   |
| 12154 | Manager    | 启动流式复制                      | 次要   |
| 12155 | Manager    | 重启流式复制                      | 次要   |
| 12156 | Manager    | 停止流式复制                      | 次要   |
| 12157 | Manager    | 周期性同步跳过                     | 次要   |
| 12158 | Manager    | 主机信息丢失                      | 次要   |
| 14005 | HDFS       | NameNode主备倒换                | 次要   |
| 14028 | HDFS       | HDFS磁盘均衡任务                  | 次要   |
| 14029 | HDFS       | 主NameNode进入安全模式并生成新的FSimage | 次要   |
| 17001 | Oozie      | Oozie工作流执行失败                | 重要   |
| 17002 | Oozie      | Oozie定时任务执行失败               | 重要   |
| 18001 | Yarn       | ResourceManager主备倒换         | 次要   |
| 18004 | Mapreduce  | JobHistoryServer主备倒换        | 次要   |
| 18029 | Yarn       | 作业占用存储资源过多                  | 次要   |
| 19001 | HBase      | HMaster主备倒换                 | 次要   |
| 19027 | HBase      | RegionServer级别热点转移          | 重要   |
| 19028 | HBase      | 热点Region分裂                  | 重要   |
| 19029 | HBase      | 热点Region隔离                  | 重要   |
| 20003 | Hue        | Hue发生主备切换                   | 次要   |
| 23002 | Loader     | Loader主备倒换                  | 重要   |
| 24002 | Flume      | Flume Channel溢出             | 重要   |
| 25001 | LdapServer | LdapServer主备倒换              | 次要   |
| 27000 | DBService  | DBServer主备倒换                | 次要   |
| 38003 | Kafka      | Topic数据保存周期配置调整             | 提示   |
| 43014 | Spark      | Spark 数据倾斜                  | 提示   |
| 43015 | Spark      | Spark SQL 超大查询结果            | 提示   |
| 43016 | Spark      | Spark SQL执行超时               | 提示   |
| 43024 | Spark      | 启动JDBCServer                | 提示   |
| 43025 | Spark      | 停止JDBCServer                | 提示   |
| 43026 | Spark      | ZooKeeper连接成功               | 提示   |
| 43027 | Spark      | ZooKeeper连接异常               | 提示   |
| 43601 | GraphBase  | GraphBase主备切换               | 次要   |
| 45002 | HetuEngine | QAS主备倒换                     | 次要   |
| 45597 | IoTDB      | Region 副本补齐事件               | 提示   |
| 45651 | Flink      | FlinkServer主备切换             | 次要   |
   
#### 相关文档
- 如果需要配置告警事件消息通知，实现一站式集成多种推送通知方式（例如短信和邮件通知），请参考[配置MRS集群告警事件消息通知](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0062.html)。
- MRS云服务相关行为日志，可在管理控制台进行查看，请参考[查看MRS云服务操作日志](https://support.huaweicloud.com/usermanual-mrs/zh-cn_topic_0012808265.html)。
- 如需查看集群已产生的告警信息并进行处理，请参考[查看MRS集群告警](https://support.huaweicloud.com/usermanual-mrs/zh-cn_topic_0040980162.html)。
- 如需配置集群监控指标的告警阈值，请参考[配置MRS集群告警阈值](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0238.html)。
 
