
# ALM-18026 Yarn上运行失败的任务数超过阈值
#### 告警解释
告警模块按60秒周期检测Yarn root队列上失败的应用的数量，当root队列上该监控周期内新增的运行失败的应用的数量超过50时，且连续发生3次以上，触发该告警。
#### 告警属性
| 告警ID  | 告警级别 | 是否自动清除 |
|:---|:---|:---|
| 18026 | 重要   | 是      |
   
#### 告警参数
| 参数名称              | 参数含义                  |
|:---|:---|
| 来源                | 产生告警的集群名称。            |
| 服务名               | 产生告警的服务名称。            |
| 角色名               | 产生告警的角色名称。            |
| 主机名               | 产生告警的主机名。             |
| Trigger Condition | 系统当前指标取值满足自定义的告警设置条件。 |
   
#### 对系统的影响
- 大量应用任务运行失败。
- 运行失败的任务需要重新提交。
 
#### 可能原因
任务出于某种错误运行失败。
#### 处理步骤
**检查告警详情。**
1. 在FusionInsight Manager界面，选择"运维 \> 告警 \> 告警"，打开告警页面。 
   登录集群Manager具体操作，请参考[访问MRS集群Manager](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0128.html)。
   
   
2. 查看"Yarn上运行失败的任务数超过阈值"告警详情中的"附加信息"，确认监控阈值是否设置过小。 
   - 是，执行[步骤 3]。
   
   - 否，执行[步骤 4]。
   
   
   
   
3. 选择"运维 \> 告警 \> 阈值设置 \> *待操作集群的名称* \> Yarn \> 其它 \> root队列下失败的任务数"，修改该监控的阈值。执行[步骤 6]。
4. 选择"集群 \> *待操作集群的名称* \> 服务 \> Yarn \> ResourceManager(主)"，进入ResourceManager的WebUI页面。
5. 单击"Applications"下的"FAILED"，单击最上面的任务。查看"Diagnostics"对应的描述信息，根据定位的任务失败原因，处理相关问题。 
   图1单击"FAILED"   
   ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001164812040.png)
   
   
6. 等待3分钟，查看该告警是否消除。
   
   - 是，处理完毕。
   
   - 否，执行[步骤 7]。
   
   
   
   
**收集故障信息。**
7. 在FusionInsight Manager界面，选择"运维 \> 日志 \> 下载"。
8. 在"服务"中勾选待操作集群的"Yarn"。
9. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895874.png)设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后10分钟，单击"下载"。
10. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
