
# ALM-45638 FlinkServer作业失败重启次数超阈值
#### 告警解释
系统以用户配置的告警周期检查FlinkServer作业重启次数，如果重启次数超过用户配置的阈值，则发送告警。当作业重启成功，则告警恢复。
**本章节仅适用于MRS 3.1.2-LTS至3.2.0-LTS之间版本集群，MRS 3.2.0-LTS及之后版本集群请参考[ALM-45638 Flink作业失败重启次数超阈值](https://support.huaweicloud.com/usermanual-mrs/ALM-45638-1.html)处理。**
#### 告警属性
| 告警ID  | 告警级别 | 是否自动清除 |
|:---|:---|:---|
| 45638 | 次要   | 是      |
   
#### 告警参数
| 参数名称 | 参数含义       |
|:---|:---|
| 来源   | 产生告警的集群名称。 |
| 服务名  | 产生告警的服务名称。 |
| 任务名  | 产生告警的任务名称。 |
   
#### 对系统的影响
Flink作业重启次数超阈值，说明Flink作业在频繁的失败重启，需要用户介入来查看原因，是Flink作业级别告警，对FlinkServer本身无影响。
#### 可能原因
FlinkServer重启次数超阈值的原因可在具体日志中查看。
#### 处理步骤
1. 使用具有FlinkServer管理操作权限的用户登录Manager。
2. 选择"集群 \> 服务 \> Yarn"，单击"ResourceManager WebUI"后的链接进入Yarn页面。
3. 根据告警"定位信息"中的任务名找到失败任务，查找并记录失败作业的"application ID"，是否可以在Yarn页面上查看到作业日志。 
   图1作业的"application ID"   
   ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001197090275.png "点击放大")
   是，执行[步骤 4]。
   否，执行[步骤 6]。
   
   
4. 单击失败作业application ID进入作业界面。
   
   1. 单击作业"Logs"列的"Logs"，查看jobmanager日志。
      图2单击"Logs"   
      ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001151231018.png "点击放大") 
   
   2. 单击"Attempt ID"列的ID，单击"Logs"列的"Logs"，查看taskmanager日志。
      图3单击"Attempt ID"列的ID   
      ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001197070681.png "点击放大")
      图4单击"Logs"   
      ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001329171158.png "点击放大")
      ![](https://support.huaweicloud.com/usermanual-mrs/public_sys-resources/note_3.0-zh-cn.png)
      使用具有FlinkServer管理操作权限的用户登录Manager，选择"集群 \> 服务 \> Flink"，单击"Flink WebUI"后的链接，单击"作业管理"，在作业的"操作"列选择"更多 \> 作业详情"也可查看taskmanager日志。
      
   
   
   
   
5. 查看失败作业日志进行故障修复，或联系运维人员，并发送已收集的故障日志信息。操作结束。
**若无法在Yarn页面上查看日志，可通过HDFS下载日志。**
6. 返回Manager，选择"集群 \> 服务 \> HDFS"，单击"NameNode WebUI"后的链接进入HDFS页面，选择"Utilities \> Browse the file system"，在"/tmp/logs/*用户名* /logs/*失败任务的application ID*"目录下载日志。
7. 查看失败作业日志进行故障修复，或联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
FlinkServer作业重新启动成功后，则告警恢复，无需手动清除。
#### 参考信息
无。
