
# 使用CES可视化监控集群
Elasticsearch集群在生产环境中长期运行，磁盘写满、JVM内存溢出、查询队列积压等问题在演变为故障前已有征兆，但仅依靠集群本身的日志难以实现提前预警和可视化趋势分析。为此，CSS服务与云监控服务（CES）集成，实现对Elasticsearch集群的磁盘、CPU、JVM、读写延迟等核心指标进行实时采集，通过可视化监控面板直观呈现指标趋势，并在指标超过阈值时通过消息通知服务（SMN）发送告警通知，帮助运维人员将问题发现从"故障后排查"提前到"故障前预警"。
#### 功能介绍
图1监控数据流向   
![](https://support.huaweicloud.com/usermanual-css/figure/zh-cn_image_0000002629839212.png "点击放大")
监控数据流：
1. 集群创建后监控数据即自动上报至CES。
2. 通过在CES设置告警规则，实现告警通知。
3. 用户可以在控制台直接查看监控指标数据。
CES对Elasticsearch集群提供两个监控维度，可按需选择。
表1监控维度说明 
| 监控维度   | 说明                                              | 适用场景               |
|:---|:---|:---|
| **集群** | 以整个Elasticsearch集群为粒度统计聚合指标，如集群健康状态、集群级别的磁盘使用率。 | 整体健康巡检、集群级别告警。     |
| **节点** | 以单个节点为粒度统计资源指标，如某个节点的CPU使用率、JVM使用率。             | 定位热点节点、排查节点级别性能问题。 |
   
#### 推荐配置的监控指标
表2推荐监控指标 
| 关注维度          | 推荐指标                                                              | 说明                                       |
|:---|:---|:---|
| 磁盘与集群健康（日常监控） | 磁盘使用率、集群健康状态                                                      | 磁盘写满是集群不可用的首要原因，建议设置磁盘使用率 \> 85%告警。      |
| CPU与JVM       | 平均JVM堆使用率、最大JVM堆使用率、平均CPU使用率、最大CPU利用率                             | JVM堆使用率持续 \> 75%可能导致GC频繁，影响查询性能。         |
| 读写延迟与吞吐       | 平均索引延迟、平均索引速率、平均查询延迟、平均查询速率                                       | 索引/查询延迟持续升高通常表示集群负载过重或存在慢查询。             |
| 读写排队与拒绝       | Write队列中总排队任务数、Search队列中总排队任务数、Write队列中总的已拒绝任务数、Search队列中总的已拒绝任务数 | 队列拒绝意味着请求被丢弃，是集群过载的直接信号，建议设置拒绝数 \> 0 告警。 |
   
#### 约束限制
- 运行时长：集群正常运行时长须大于10分钟，CES才能采集到有效数据。
- 操作权限：操作账号需具备CES的操作权限，否则无法查看监控信息、无法配置告警规则。
 
#### 前提条件
Elasticsearch集群处于"可用"状态。
#### 查看监控信息
通过CSS控制台内置的监控入口查看集群和节点的实时监控指标数据，支持多集群数据对比和同比/环比分析。
1. 登录[云搜索服务管理控制台](https://console.huaweicloud.com/elasticsearch/)。
2. 在左侧导航栏，选择"集群管理 \> Elasticsearch"。
3. 在集群列表，选择目标集群，单击操作列的"监控指标"。
4. 按需查看**集群级监控** 或**节点级监控** 信息。
   图2查看监控信息   
   ![](https://support.huaweicloud.com/usermanual-css/figure/zh-cn_image_0000002629839214.png "点击放大")
   - **查看集群级的监控指标数据**
     在监控指标页面，选择"资源实例"页签。
     - 资源实例：选择要查看监控信息的集群。默认展示当前集群数据，支持多选其他集群进行数据横向对比。
     
     - 支持设置监控时间范围，以及查看同一集群的同比/环比数据，用于发现周期性规律或异常偏差。
     
     - 添加视图分组：支持在默认分组的基础上新增自定义的分组，将相关指标归类展示，便于聚焦分析。当鼠标悬停在左侧分组名称上，右侧会显示修改名称和删除分组的图标，可以修改分组。
     
     - 设置指标：在"设置监控指标"弹窗中，可以根据页面提示设置"原始指标"（单一指标折线图）和"TopN指标"（展示各节点该指标的Top N对比）。
       
   
   - **查看集群节点级的监控指标数据**
     在监控指标页面，选择"云服务节点"页签。
     - 云服务节点：选择要查看监控信息的集群节点。默认展示当前集群的第一个节点的数据。支持多选其他节点进行数据横向对比。
     
     - 支持设置监控时间范围，以及查看同一集群的同比/环比数据。
     
     - 添加视图分组：支持在默认分组的基础上新增自定义的分组，将相关指标归类展示，便于聚焦分析。当鼠标悬停在左侧分组名称上，右侧会显示修改名称和删除分组的图标，可以修改分组。
     
     - 设置指标：在"设置监控指标"弹窗中，可以根据页面提示设置"原始指标"（单一指标折线图）。
       
    
5. （可选）如需查看可视化监控看板，请参见[方式一：使用监控大盘进行趋势分析](https://support.huaweicloud.com/usermanual-css/css_01_0250.html#ZH-CN_TOPIC_0000002005581684__section7641843193810)。
   监控大盘可以将多个指标的时序趋势图集中展示，便于日常巡检时一屏掌握集群整体状态。
   
 
#### 配置监控告警
设置监控指标的触发阈值和通知方式，当集群指标异常时主动推送告警，实现"被动发现问题"到"主动预警"的转变。
1. 登录[云监控服务管理控制台](https://console.huaweicloud.com/ces/)。
2. 左侧导航栏选择"告警 \> 告警规则"，进入告警规则列表页面。
3. 在告警规则列表，搜索"资源类型"为"云搜索服务"，确认是否已有满足业务需求的告警规则。 如需新建告警规则，请参见[创建告警规则和通知](https://support.huaweicloud.com/usermanual-ces/zh-cn_topic_0084572213.html)。[表3]列举了关键参数配置说明，其他参数请根据业务需求自定义。
    表3告警规则的关键参数配置说明 
   | 参数   | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                            |
   |:---|:---|
   | 告警类型 | 选择"指标"。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                       |
   | 云产品  | 选择"云搜索服务 - CSS集群"。                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                            |
   | 资源层级 | 选择"子维度"，右侧根据业务需求选择子维度。 - "CSS集群"：以整个集群为粒度指定告警规则。  - "CSS集群 - 云服务节点"：以单个节点为粒度指定告警规则。   |
      
   图3集群/节点的告警规则配置   
   ![](https://support.huaweicloud.com/usermanual-css/figure/zh-cn_image_0000002659998477.png)   
   ![](https://support.huaweicloud.com/usermanual-css/figure/zh-cn_image_0000002629679302.png) 
4. 告警规则创建成功后，在告警规则列表中可查看新建的规则，"状态"为"启用"。
 
