
# ALM-45007 HetuEngine计算实例Worker个数小于阈值
#### 告警解释
系统每60秒周期性检测HetuEngine计算实例的Worker个数，当检测到HetuEngine计算实例的Worker个数小于初始设置值的80%时产生该告警。
HetuEngine计算实例运行的Worker个数大于等于初始设置值的80%时，告警清除。
本章节仅适用于MRS 3.3.1-LTS及之后版本。
#### 告警属性
| 告警ID  | 告警级别 | 是否可自动清除 |
|:---|:---|:---|
| 45007 | 重要   | 是       |
   
#### 告警参数
| 类别   | 参数名称                  | 参数含义                    |
|:---|:---|:---|
| 定位信息 | 来源                    | 产生告警的集群名称。              |
| 定位信息 | 服务名                   | 产生告警的服务名称。              |
| 定位信息 | 角色名                   | 产生告警的角色名称。              |
| 定位信息 | 主机名                   | 产生告警的主机名。               |
| 附加信息 | Worker Less Threshold | 产生告警的计算实例租户名和当前超过阈值的大小。 |
   
#### 对系统的影响
HetuEngine计算实例Worker个数不足，会导致该计算实例性能下降、业务SQL响应变慢。
#### 可能原因
- Yarn资源队列的资源不足。
- 业务运行任务量过大，导致Worker节点OOM内存溢出，从而导致Worker节点减少。
 
#### 处理步骤
**检查Yarn资源队列的资源是否充足**
1. 使用可访问HetuEngine WebUI界面的管理员用户登录FusionInsight Manager。 
   登录集群Manager具体操作，请参考[访问MRS集群Manager](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0128.html)。
   
   
2. 选择"运维 \> 告警 \> 告警 \> HetuEngine计算实例Worker个数小于阈值"，检查该告警的"附加信息"，查看并记录告警上报的租户名。
3. 选择"租户资源 \> 租户资源管理 "，在租户列表选择对应计算实例的租户，查看该租户的资源配额是否充足。 
   - 是，执行[步骤 6]。
   
   - 否，执行[步骤 4]。
   
   
   
   
4. 根据实际使用情况，增加该租户资源容量的最大百分比。
5. 等待5-10分钟，查看告警是否消失。 
   - 是，处理完毕。
   
   - 否，执行[步骤 6]。
   
   
   
   
**查看业务运行任务量是否过大**
6. 选择"集群 \> 服务 \> HetuEngine"，进入HetuEngine服务页面。
7. 在"概览"页签下的"基本信息"区域，单击"HSConsole Web UI"后的链接，进入HSConsole界面。
8. 在"计算实例"页签，展开对应租户下的实例，单击计算实例"WebUI"列的"LINK"，查看所有任务的运行情况。
9. 查看正在运行的任务个数是否过大（超过50）。 
   - 是，执行[步骤 10]。
   
   - 否，执行[步骤 12]。
   
   
   
   
10. 联系业务侧根据实际情况调整业务提交方式，或者增加计算实例资源。
11. 等待5-10分钟，查看告警是否消失。 
    - 是，处理完毕。
    
    - 否，执行[步骤 12]。
    
    
    
    
**收集故障信息。**
12. 在FusionInsight Manager界面，选择"运维 \> 日志 \> 下载"。
13. 在"服务"中勾选"HetuEngine"，单击"确定"。
14. 在"主机"中勾选对应角色所在的主机，单击"确定"。
15. 单击右上角的时间编辑按钮，设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后10分钟，单击"下载"。
16. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
不涉及。
