
# ALM-16004 Hive服务不可用
#### 告警解释
系统每60秒周期性检测Hive服务状态。当Hive服务不可用时产生该告警。
当Hive服务恢复时，告警恢复。
#### 告警属性
| 告警ID  | 告警级别 | 是否自动清除 |
|:---|:---|:---|
| 16004 | 紧急   | 是      |
   
#### 告警参数
| 参数名称 | 参数含义       |
|:---|:---|
| 来源   | 产生告警的集群名称。 |
| 服务名  | 产生告警的服务名称。 |
| 角色名  | 产生告警的角色名称。 |
| 主机名  | 产生告警的主机名。  |
   
#### 对系统的影响
系统无法提供数据加载、查询、提取服务。
#### 可能原因
- Hive服务不可用可能与ZooKeeper、HDFS、Yarn和DBService等基础服务有关，也可能由Hive自身的进程故障引起。
  - ZooKeeper服务异常。
  
  - HDFS服务异常。
  
  - Yarn服务异常。
  
  - DBService服务异常。
  
  - Hive服务进程故障，如果告警由Hive进程故障引发，告警上报时间可能会延迟5分钟左右。
   
- Hive服务和基础服务间的网络通信中断。
- Hive的HDFS临时目录权限异常。
- Hive节点本地磁盘空间不足。
 
#### 处理步骤
**检查HiveServer/MetaStore进程状态。**
1. 在集群Manager首页，选择"集群 \> 服务 \> Hive \> 实例"，在Hive实例列表中，查看所有HiveServer或MetaStore实例状态是否都呈现未知状态。 
   登录集群Manager具体操作，请参考[访问MRS集群Manager](https://support.huaweicloud.com/usermanual-mrs/mrs_01_0128.html)。
   - 是，执行[步骤 2]。
   
   - 否，执行[步骤 4]。
   
   
   
   
2. 在Hive实例列表上方，选择"更多 \> 重启实例"，重启HiveServer/MetaStore进程。
   
   ![](https://support.huaweicloud.com/usermanual-mrs/public_sys-resources/warning_3.0-zh-cn.png)
   正在重启的HiveServer/MetaStore实例无法对外提供服务，对应实例上正在执行的SQL任务可能失败。
   
   
3. 在告警列表中，查看"Hive服务不可用"告警是否清除。 
   - 是，处理完毕。
   
   - 否，执行[步骤 4]。
   
   
   
   
**检查ZooKeeper服务状态。**
4. 在Manager的告警列表中，查看是否有"进程故障"告警产生。
   
   - 是，执行[步骤 5]。
   
   - 否，执行[步骤 8]。
   
   
   
   
5. 在"进程故障"告警的定位信息中，查看"服务名"是否为"ZooKeeper"。
   
   - 是，执行[步骤 6]。
   
   - 否，执行[步骤 8]。
   
   
   
   
6. 参考[ALM-12007 进程故障](https://support.huaweicloud.com/usermanual-mrs/ALM-12007.html)的处理步骤处理该故障。
7. 在告警列表中，查看"Hive服务不可用"告警是否清除。 
   - 是，处理完毕。
   
   - 否，执行[步骤 8]。
   
   
   
   
**检查HDFS服务状态。**
8. 在Manager的告警列表中，查看是否有"HDFS服务不可用"告警产生。
   
   - 是，执行[步骤 9]。
   
   - 否，执行[步骤 11]。
   
   
   
   
9. 参考[ALM-14000 HDFS服务不可用](https://support.huaweicloud.com/usermanual-mrs/ALM-14000.html)的处理步骤处理该故障。
10. 在告警列表中，查看"Hive服务不可用"告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 11]。
    
    
    
    
**检查Yarn服务状态。**
11. 在Manager的告警列表中，查看是否有"Yarn服务不可用"告警产生。
    
    - 是，执行[步骤 12]。
    
    - 否，执行[步骤 14]。
    
    
    
    
12. 参考[ALM-18000 Yarn服务不可用](https://support.huaweicloud.com/usermanual-mrs/ALM-18000.html)的处理步骤处理该故障。
13. 在告警列表中，查看"Hive服务不可用"告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 14]。
    
    
    
    
**检查DBService服务状态。**
14. 在Manager的告警列表中，查看是否有"DBService服务不可用"告警产生。
    
    - 是，执行[步骤 15]。
    
    - 否，执行[步骤 17]。
    
    
    
    
15. 参考[ALM-27001 DBService服务不可用](https://support.huaweicloud.com/usermanual-mrs/ALM-27001.html)的处理步骤处理该故障。
16. 在告警列表中，查看"Hive服务不可用"告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 17]。
    
    
    
    
**检查Hive与ZooKeeper、HDFS、Yarn和DBService之间的网络连接。**
17. 在Manager首页，选择"集群 \> 服务 \> Hive"。
18. 单击"实例"，进入Hive实例列表页面。
19. 单击"HiveServer"所在行的"主机名称"，进入HiveServer主机状态页面。
20. 记录"基本信息"中的业务IP地址。
21. 以**omm** 用户通过[步骤 20]获取的IP地址登录HiveServer所在的主机。

22. 执行**ping** 命令，查看HiveServer所在主机与ZooKeeper、HDFS、Yarn和DBService服务所在主机的网络连接是否正常。（获取ZooKeeper、HDFS、Yarn和DBService服务所在主机的IP地址的方式和获取HiveServer IP地址的方式相同。）
    
    - 是，执行[步骤 25]。
    
    - 否，执行[步骤 23]。
    
    
    
    
23. 联系网络管理员恢复网络。
24. 在告警列表中，查看"Hive服务不可用"告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 25]。
    
    
    
    
**检查HDFS临时目录权限。**
25. 登录客户端所在节点，执行以下命令进入HDFS客户端安装目录。
    
    切换至客户端安装目录：
    ```
    cd 客户端安装目录
    ```
    配置环境变量：
    ```
    source bigdata_env
    ```
    如果集群已启用Kerberos认证（安全模式），需执行以下命令认证用户：
    ```
    kinit 具有supergroup组权限的用户
    ```
    
    
26. 执行以下命令查看数据仓库目录权限是否为770： 
    ```
    hdfs dfs -ls /tmp | grep hive-scratch
    ```
    - 是，执行[步骤 29]。
    
    - 否，执行[步骤 27]。
    
    
    
    
27. 执行以下命令修复默认数据仓库权限：
    
    ```
    hdfs dfs -chmod 770 /tmp/hive-scratch
    ```
    
    
28. 等待几分钟查看"Hive服务不可用"告警是否清除。 
    - 是，处理完毕。
    
    - 否，执行[步骤 29]。
    
    
    
    
**检查本地磁盘空间是否正常。**
29. 执行以下命令检查根目录，查看"/srv"、"/var"和"/opt"目录挂载的磁盘使用是否超过95%。
    
    ```
    df -h
    ```
    - 是，执行[步骤 30]。
    
    - 否，执行[步骤 31]。
    
    
    
    
30. 清理对应目录下无用信息，保证可用磁盘空间大于80%，等待几分钟查看"Hive服务不可用"告警是否清除。
    
    - 是，处理完毕。
    
    - 否，执行[步骤 31]。
    
    
    
    
**收集故障信息。**
31. 在Manager首页，选择"运维 \> 日志 \> 下载"。
32. 在"服务"中勾选待操作集群的如下节点信息。 
    - ZooKeeper
    
    - HDFS
    
    - Yarn
    
    - DBService
    
    - Hive
    
    
    
    
33. 单击右上角的![](https://support.huaweicloud.com/usermanual-mrs/zh-cn_image_0263895897.png)设置日志收集的"开始时间"和"结束时间"，分别为告警产生时间的前后10分钟，单击"下载"。
34. 请联系运维人员，并发送已收集的故障日志信息。
 
#### 告警清除
此告警修复后，系统会自动清除此告警，无需手工清除。
#### 参考信息
无。
