更新时间:2026-09-15 GMT+08:00
分享

DWS_2000000012 DWS集群节点数据盘时延超阈值

告警解释

DWS每30秒采集集群各节点的数据盘时延。如果某节点的某数据盘最近10分钟(可配置)内的平均时延超过400ms(可配置),则上报节点数据盘时延超阈值告警;如果平均使用率低于400ms,则消除告警。

如果节点数据盘时延一直大于上报阈值,那么在24小时(可配置)后将再次发起告警。

告警属性

告警ID

告警归属

告警级别

告警类型

业务类型

是否可自动清除

DWS_2000000012

租户面

>400ms 重要

操作告警

数据仓库服务

告警参数

类别

参数名称

参数含义

定位信息

名称

DWS集群节点数据盘时延超阈值。

类型

操作告警。

发生时间

告警发生时间。

附加信息

集群ID

集群resourceId、domain_id等详细信息。

告警指标

调用获取指定指标相关采集数据 - ListMetricsDataAPI接口获取该告警指标,其中接口中的指标名称为IOStat

  • 请求示例
    GET https://{Endpoint}/v1/{project_id}/clusters/{cluster_id}/dms/metrics/IOStat?offset=0&limit=1&from=1786782138946&to=1786782238946&order_by=ctime&sort_by=desc
  • 响应示例

    告警指标为响应结果中的await参数(平均每次I/O请求的等待时间,单位:ms)。

    {
     "code": 0,
     "msg": "OK",
     "data": [
      {
       "virtual_cluster_id": 81882,
       "disk_name": "vdb",
       "rkb_s": 0,
       "wrqm_s": 0,
       "r_s": 0,
       "w_s": 4,
       "host_id": 83728,
       "kb_read_s": 0,
       "svctm": 0,
       "rrqm_s": 0,
       "avgqu_sz": 0,
       "util": 0.15,
       "kb_wrtn": 0,
       "tps": 0,
       "await": 0.29,
       "ctime": 1786782188000,
       "kb_wrtn_s": 11.62,
       "avgrq_sz": 2.01,
       "kb_read": 0,
       "wkb_s": 11.62
      }
     ],
     "count": 21
    }

对系统的影响

磁盘时延高会导致集群性能下降,影响数据的读写速度,可能对业务产生影响。

可能原因

数据库处于业务高峰,存在大量的读写请求,导致磁盘响应慢,时延较高。

处理步骤

  1. 进入“集群 > 集群列表”页面,单击指定集群所在行操作列的“监控面板”进入触发告警的集群的监控面板。
  2. 在左侧导航栏选择“监控>节点监控”,进入节点监控页面查看CPU使用率、磁盘使用率、内存使用率等信息。

    如果CPU使用率、磁盘I/O速率高,则说明集群处于业务高峰期,用户可结合自身业务情况调整时延阈值,请参见3

  3. 返回控制台首页,在左导航栏选择“监控 > 告警”,切换至“告警”页签,单击左上角的“告警规则管理”,进入告警规则页面。
  4. 在“节点数据盘时延告警”规则所在行操作列,单击“修改”进入修改告警规则页面,修改其阈值。

告警清除

数据盘时延下降后,自动消除告警。

相关文档