
# ALM-14010 NameService服务异常
#### 告警解释
系统每180秒周期性检测NameService服务状态，当检测到NameService服务不可用时产生该告警。
NameService服务恢复时，告警清除。
#### 告警属性
| 告警ID  | 告警级别 | 是否自动清除 |
|:---|:---|:---|
| 14010 | 重要   | 是      |
   
#### 告警参数
| 参数名称         | 参数含义                |
|:---|:---|
| 来源           | 产生告警的集群名称。          |
| 服务名          | 产生告警的服务名称。          |
| 角色名          | 产生告警的角色名称。          |
| 主机名          | 产生告警的主机名。           |
| NameService名 | 产生告警的NameService名称。 |
   
#### 对系统的影响
无法为基于该NameService服务的HBase和MapReduce等上层部件提供服务，用户无法读写文件。
#### 可能原因
- KrbServer服务异常。
- JournalNode节点故障。
- DataNode节点故障。
- 磁盘容量不足。
- NameNode节点进入安全模式。
 
#### 处理步骤
**检查KrbServer服务状态。**
1. 在FusionInsight Manager首页，选择"集群 \> 服务"。 
   登录集群Manager具体操作，请参考[访问MRS集群Manager](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0128.html)。
   
   
2. 查看服务列表中KrbServer服务是否存在。 
   - 是，执行[步骤 3]。
   
   - 否，执行[步骤 6]。
   
   
   
   
3. 单击"KrbServer"。
4. 单击"实例"。在KrbServer管理页面，选择故障实例，选择"更多 \> 重启实例"，查看实例能否成功启动。 
   - 是，执行[步骤 5]。
   
   - 否，执行[步骤 24]。
   
   
   
   
5. 在"运维 \> 告警 \> 告警"页签，查看该告警是否恢复。
   
   - 是，处理完毕。
   
   - 否，执行[步骤 6]。
   
   
   
   
**检查JournalNode实例状态。**
6. 在FusionInsight Manager首页，选择"集群 \> 服务"。
7. 选择"HDFS \> 实例"。
8. 在实例页面中，查看JournalNode的"运行状态"是否为"良好"。 
   - 是，执行[步骤 11]。
   
   - 否，执行[步骤 9]。
   
   
   
   
9. 选择故障的JournalNode，选择"更多 \> 重启实例"，查看JournalNode能否成功启动。
   
   **JournalNode实例重启数量超过JournalNode总数的三分之一时，可能会导致HDFS服务故障。**
   - 是，执行[步骤 10]。
   
   - 否，执行[步骤 24]。
   
   
   
   
10. 在"运维 \> 告警 \> 告警"页签，查看该告警是否恢复。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 11]。
    
    
    
    
**检查DataNode实例状态。**
11. 在FusionInsight Manager首页，选择"集群 \> 服务 \> HDFS"。
12. 单击"实例"查看所有DataNode节点的"运行状态"是否为"良好"。 
    - 是，执行[步骤 15]。
    
    - 否，执行[步骤 13]。
    
    
    
    
13. 单击"实例"。在DataNode管理页面，选择故障DataNode，选择"更多 \> 重启实例"，查看DataNode能否成功启动。
    
    ![](https://support.huaweicloud.com/usermanual-mrs/public_sys-resources/note_3.0-zh-cn.png)
    重启期间服务业务可能受损或中断，建议选择业务低峰期操作。
    - 是，执行[步骤 14]。
    
    - 否，执行[步骤 15]。
    
    
    
    
14. 在"运维 \> 告警 \> 告警"页签，查看该告警是否恢复。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 15]。
    
    
    
    
**检查磁盘状态。**
15. 在FusionInsight Manager首页，选择"主机"。
16. 在"磁盘"列，检查集群各节点磁盘空间是否不足。 
    - 是，执行[步骤 17]。
    
    - 否，执行[步骤 19]。
    
    
    
    
17. 对磁盘进行扩容。
18. 在"运维 \> 告警 \> 告警"页签，查看该告警是否恢复。 
    - 是，处理完毕。
    
    - 否，执行[步骤 19]。
    
    
    
    
**检查NameNode节点是否进入安全模式。**
19. 在FusionInsight Manager首页，选择"集群 \> 服务 \> HDFS"，单击服务异常的NameService的"NameNode(主)"，显示NameNode WebUI页面。
    
    ![](https://support.huaweicloud.com/usermanual-mrs/public_sys-resources/note_3.0-zh-cn.png)
    **admin**用户默认不具备其他组件的管理权限，如果访问组件原生界面时出现因权限不足而打不开页面或内容显示不全时，可手动创建具备对应组件管理权限的用户进行登录。
    
    
20. 在NameNode WebUI，查看是否显示如下信息："Safe mode is ON." 
    "Safe mode is ON."表示安全模式已打开，后面的提示信息为告警信息，根据实际情况展现。
    - 是，执行[步骤 21]。
    
    - 否，执行[步骤 24]。
    
    
    图1Overview   
    ![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0000001164603454.png "点击放大")
    
    
21. 以**root** 用户登录集群客户端所在节点，用户密码为安装前用户自定义，请咨询系统管理员。
    
    执行命令进入客户端安装目录，然后加载环境变量。
    ```
    cd 客户端安装目录
    ```
    ```
    source bigdata_env
    ```
    - 如果集群开启了Kerberos认证，要进行安全认证。
      ```
      kinit hdfs
      ```
      命令执行后按提示输入密码（可向MRS集群管理员获取密码），也可以使用其他具有HDFS管理权限的用户。
      
    
    - 如果集群未开启Kerberos认证，需使用**omm** 用户登录并执行命令，请确保**omm**用户具有客户端执行权限。
    
    
    
    
22. 执行以下命令退出HDFS安全模式。 
    ```
    hdfs dfsadmin -safemode leave
    ```
    
    
23. 在Manager的"运维 \> 告警 \> 告警"页签，查看该告警是否恢复。 
    - 是，处理完毕。
    
    - 否，执行[步骤 24]。
    
    
    
    
**收集故障信息。**
24. 在FusionInsight Manager首页，选择"运维 \> 日志 \> 下载"。
25. 在"服务"中勾选待操作集群的如下节点信息。 
    - ZooKeeper
    
    - HDFS
    
    
    
    
26. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895680.png)设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后10分钟，单击"下载"。
27. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
