
# 使用CES可视化监控集群
Logstash集群作为数据处理管道的核心组件，长期承载着日志采集、格式转换和数据分发等高负载任务，一旦节点出现CPU过载或JVM内存不足，轻则导致管道处理延迟、数据积压，重则引发节点异常退出、数据丢失。然而依靠运维人员定期登录集群手动检查，不仅效率低下，更难以在问题萌芽阶段及时介入。为此，CSS服务与云监控服务（CES）集成，实现对节点的CPU、JVM等关键运行指标进行实时采集与可视化展示，并在指标超过阈值时通过消息通知服务（SMN）发送告警通知，帮助运维人员将问题发现从"故障后排查"提前到"故障前预警"。
#### 功能介绍
图1监控数据流向   
![](https://support.huaweicloud.com/usermanual-css/figure/zh-cn_image_0000002660118547.png "点击放大")
监控数据流：
1. 集群创建后监控数据即自动上报至CES。
2. 通过在CES设置告警规则，实现告警通知。
3. 用户可以在控制台直接查看监控指标数据。
CES对Logstash集群提供四个监控维度，可按需选择。
表1监控维度说明 
| 监控维度            | 说明                                    | 适用场景                    |
|:---|:---|:---|
| **集群**          | 以整个Logstash集群为粒度统计聚合指标，反映集群整体资源水位。    | 整体健康巡检、集群级别告警。          |
| **节点**          | 以单个Logstash节点（VM）为粒度统计资源指标。           | 定位热点节点、排查单节点CPU/JVM瓶颈。  |
| **Pipeline**    | 以集群维度统计所有Pipeline的聚合运行指标，如事件吞吐量、处理延迟。 | 监控集群整体的管道处理能力，发现全局管道异常。 |
| **单节点Pipeline** | 以单个节点上运行的Pipeline为粒度统计运行指标。           | 精准定位某个节点上特定管道的处理瓶颈。     |
   
#### 推荐配置的监控指标
表2推荐监控指标 
| 关注维度    | 推荐指标                                                                                       | 说明                                 |
|:---|:---|:---|
| CPU与JVM | 平均JVM堆使用率、最大JVM堆使用率、平均CPU使用率、最大CPU利用率                                                      | JVM堆使用率持续 \> 75%可能导致GC频繁，影响数据处理性能。 |
| 管道吞吐    | logstash_pipeline_events_in、logstash_pipeline_events_filtered、logstash_pipeline_events_out | 输入与输出差值持续增大通常表示处理能力不足或下游阻塞。        |
   
#### 约束限制
- 运行时长：集群正常运行时长须大于10分钟，CES才能采集到有效数据。
- 操作权限：操作账号需具备CES的操作权限，否则无法查看监控信息、无法配置告警规则。
 
#### 前提条件
Logstash集群处于"可用"状态。
#### 查看集群/节点级监控信息
通过CSS控制台内置的监控入口查看集群和节点的实时监控指标数据，支持多集群数据对比和同比/环比分析。
1. 登录[云搜索服务管理控制台](https://console.huaweicloud.com/elasticsearch/)。
2. 在左侧导航栏，选择"集群管理 \> Logstash"。
3. 在集群列表，选择目标集群，单击操作列的"监控指标"。
4. 按需查看**集群级监控** 或**节点级监控** 信息。
   图2查看监控信息   
   ![](https://support.huaweicloud.com/usermanual-css/figure/zh-cn_image_0000002659998479.png "点击放大")
   - **查看集群级的监控指标数据**
     在监控指标页面，选择"资源实例"页签。
     - 资源实例：选择要查看监控信息的集群。默认展示当前集群数据，支持多选其他集群进行数据横向对比。
     
     - 支持设置监控时间范围，以及查看同一集群的同比/环比数据，用于发现周期性规律或异常偏差。
     
     - 添加视图分组：支持在默认分组的基础上新增自定义的分组，将相关指标归类展示，便于聚焦分析。当鼠标悬停在左侧分组名称上，右侧会显示修改名称和删除分组的图标，可以修改分组。
     
     - 设置指标：在"设置监控指标"弹窗中，可以根据页面提示设置"原始指标"（单一指标折线图）和"TopN指标"（展示各节点该指标的Top N对比）。
       
   
   - **查看集群节点级的监控指标数据**
     在监控指标页面，选择"云服务节点"页签。
     - 云服务节点：选择要查看监控信息的集群节点。默认展示当前集群的第一个节点的数据。支持多选其他节点进行数据横向对比。
     
     - 支持设置监控时间范围，以及查看同一集群的同比/环比数据。
     
     - 添加视图分组：支持在默认分组的基础上新增自定义的分组，将相关指标归类展示，便于聚焦分析。当鼠标悬停在左侧分组名称上，右侧会显示修改名称和删除分组的图标，可以修改分组。
     
     - 设置指标：在"设置监控指标"弹窗中，可以根据页面提示设置"原始指标"（单一指标折线图）。
       
    
5. （可选）如需查看可视化监控看板，请参见[方式一：使用监控大盘进行趋势分析](https://support.huaweicloud.com/usermanual-css/css_01_0250.html#ZH-CN_TOPIC_0000002005581684__section7641843193810)。
   监控大盘可以将多个指标的时序趋势图集中展示，便于日常巡检时一屏掌握集群整体状态。
   
 
#### 查看Pipeline监控信息
通过配置中心入口查看集群级或节点级的Pipeline运行指标，定位管道处理瓶颈。
1. 登录[云搜索服务管理控制台](https://console.huaweicloud.com/elasticsearch/)。
2. 在左侧导航栏，选择"集群管理 \> Logstash"。
3. 在集群列表，选择目标集群，单击操作列的"配置中心"。
4. 在管道列表，单击操作列的"指标监控"，跳转到CES监控指标页面，查看**当前集群中所有Pipeline的聚合监控指标信息**。
5. 单击页面上方的返回按钮，进入自定义监控页面。
6. 按需查看**集群级** 或**节点级** Pipeline监控信息。
   1. **查看集群级Pipeline监控指标数据**
      在自定义监控页面，选择"cluster_id,pipeline_name"页签，选择目标监控对象，单击操作列的"查看监控指标"，进入监控指标页面查看数据。
      
   
   2. **查看节点级Pipeline监控指标数据**
      在自定义监控页面，选择"cluster_id,instance_id,pipeline_name"页签，选择目标监控对象，单击操作列的"查看监控指标"，进入监控指标页面查看数据。
      
    
 
#### 配置监控告警
设置监控指标的触发阈值和通知方式，当集群指标异常时主动推送告警，实现"被动发现问题"到"主动预警"的转变。
1. 登录[云监控服务管理控制台](https://console.huaweicloud.com/ces/)。
2. 左侧导航栏选择"告警 \> 告警规则"，进入告警规则列表页面。
3. 在告警规则列表，搜索"资源类型"为"云搜索服务"（集群/节点级）或"CSS.CUSTOM"（Pipeline维度），确认是否已有满足业务需求的告警规则。 如需新建告警规则，请参见[创建告警规则和通知](https://support.huaweicloud.com/usermanual-ces/zh-cn_topic_0084572213.html)。下面列举了关键参数配置说明，其他参数请根据业务需求自定义。
   - **集群/节点级告警规则**
     表3集群/节点级告警规则的关键参数配置说明 
     | 参数   | 说明                                                                                                                                                                                                                                                                                                                                                                               |
     |:---|:---|
     | 告警类型 | 选择"指标"。                                                                                                                                                                                                                                                                                                                                                                          |
     | 云产品  | 选择"云搜索服务 - CSS集群"。                                                                                                                                                                                                                                                                                                                                                               |
     | 资源层级 | 选择"子维度"，右侧根据业务需求选择子维度。 - "CSS集群"：以整个集群为粒度指定告警规则。  - "CSS集群 - 云服务节点"：以单个节点为粒度指定告警规则。   |
        
     图3集群/节点的告警规则配置   
     ![](https://support.huaweicloud.com/usermanual-css/figure/zh-cn_image_0000002629839206.png)   
     ![](https://support.huaweicloud.com/usermanual-css/figure/zh-cn_image_0000002629839208.png) 
   
   - **Pipeline维度告警规则**
     表4Pipeline维度告警规则的关键参数配置说明 
     | 参数   | 说明                                                                                                                                                                                                                                                                                                                                                                                                                                                   |
     |:---|:---|
     | 告警类型 | 选择"指标"。                                                                                                                                                                                                                                                                                                                                                                                                                                              |
     | 云产品  | 选择"CSS.CUSTOM"。                                                                                                                                                                                                                                                                                                                                                                                                                                      |
     | 资源层级 | 只有"子维度"，右侧根据实际需求选择子维度。 - "cluster_id,pipeline_name"：以集群中所有Pipeline聚合为粒度指定告警规则。  - "cluster_id,instance_id,pipeline_name"：以集群单节点上运行的Pipeline为粒度指定告警规则。   |
        
     图4Pipeline的告警规则配置   
     ![](https://support.huaweicloud.com/usermanual-css/figure/zh-cn_image_0000002660118549.png)   
     ![](https://support.huaweicloud.com/usermanual-css/figure/zh-cn_image_0000002660118545.png) 
    
4. 告警规则创建成功后，在告警规则列表中可查看新建的规则，"状态"为"启用"。
 
