DWS_2000000030 DWS集群会话数量使用率超阈值
告警解释
DMS告警模块在指定周期内,检测到集群会话数量使用率超过当前设定阈值,且抑制条件不满足时,DMS告警模块将触发该告警;检测到集群会话数量使用率低于当前设定阈值时,DMS告警模块将消除该告警。
告警属性
| 告警ID | 告警归属 | 告警级别 | 告警类型 | 业务类型 | 是否可自动清除 |
|---|---|---|---|---|---|
| DWS_2000000030 | 租户面 | >90 紧急,>80 重要 | 业务告警 | 数据仓库服务 | 是 |
告警变更
| 变更类型 | 变更版本 | 变更描述 | 变更原因 |
|---|---|---|---|
| 新增 | 9.1.0.227 | 首次增加 | 首次增加 |
告警参数
| 类别 | 参数名称 | 参数含义 |
|---|---|---|
| 定位信息 | 集群名称 | 产生告警的集群名称。 |
| 租户名称 | 集群所属的租户名称。 | |
| 告警级别 | 产生告警的级别。 | |
| 附加信息 | 资源ID | 产生告警的集群ID。 |
| 资源名称 | 产生告警的集群名称。 | |
| 首次告警时间 | 告警首次发生时间,包含告警阈值与当前值。 |
告警指标
调用获取指定指标相关采集数据 - ListMetricsDataAPI接口获取该告警指标,其中接口中的指标名称为QueryMonitor。
- 请求示例:
GET https://{Endpoint}/v1/{project_id}/clusters/{cluster_id}/dms/metrics/QueryMonitor?offset=0&limit=1&from=1786782138946&to=1786784159004&order_by=ctime&sort_by=desc - 响应示例:
告警指标为响应结果中count参数(数据条数)。
{ "code": 0, "msg": "OK", "data": [ { "query_id": "80220368369538752", "backend_start": 1786783088, "pid": "140504051222312", "block_time": 0, "application_name": "OM", "estimate_total_time": 0, "memory_skew_percent": 0, "max_peak_memory": 0, "iops_skew_percent": 0, "min_peak_memory": 0, "ctime": 1786783088000, "warning": "", "min_cpu_time": 0, "total_cpu_time": 0, "dntime_skew_percent": 0, "average_spill_size": 0, "query": "/* autopilot */ SELECT pgsac.datname as db_name, pgws.nodename as inst_name, pgsac.pid as pid, pgsac.query_id as query_id, pgws.query_band, null as job_name, null as job_inst, pgsac.usename as user_name, pgsac.application_name, pgsac.client_addr as client_address, pgsac.client_hostname, pgsac.client_port, pgsac.waiting, extract('epoch' from pgws.start_time at time zone 'UTC')::bigint as start_time, pgswlm.block_time, pgws.duration, pgws.estimate_total_time, pgws.estimate_left_time, pgswlm.enqueue, pgswlm.priority, pgsac.resource_pool, pgws.control_group, pgws.min_peak_memory, pgws.max_peak_memory, pgws.average_peak_memory, pgws.memory_skew_percent, pgws.estimate_memory, pgws.spill_info, pgws.min_spill_size, pgws.max_spill_size, pgws.average_spill_size, pgws.spill_skew_percent, pgws.min_dn_time, pgws.max_dn_time, pgws.average_dn_time, pgws.dntime_skew_percent, pgws.min_cpu_time, pgws.max_cpu_time, pgws.total_cpu_time, pgws.cpu_skew_percent, pgws.warning, pgws.average_peak_iops, pgws.iops_skew_percent, pgws.ma", "priority": 2, "start_time": 0, "max_spill_size": 0, "db_name": "postgres", "average_peak_memory": 0, "query_plan": "", "query_band": "", "job_inst": "", "wlm_attrib": "Internal", "spill_info": "", "virtual_cluster_id": 81882, "waiting": false, "average_dn_time": 0, "user_name": "Ruby", "min_spill_size": 0, "query_status": "active", "resource_pool": "root", "duration": 0, "client_port": "-1", "estimate_memory": 0, "elapsed_time": 0, "curr_xact_start": 1786783088, "client_address": "", "lane": "None", "query_elapsed_time": 0, "control_group": "", "average_peak_iops": 0, "query_start": 1786783088, "max_dn_time": 0, "cpu_skew_percent": 0, "min_peak_iops": 0, "enqueue": "None", "job_name": "", "client_hostname": "", "spill_skew_percent": 0, "system_query": true, "estimate_left_time": 0, "min_dn_time": 0, "wlm_status": "running", "max_peak_iops": 0, "inst_name": "cn_5001", "max_cpu_time": 0, "state_change": 1786783088 } ], "count": 166 }
对系统的影响
可使用会话数量不足,影响业务执行。
可能原因
max_connections参数设置过低。
处理步骤
- 登录DWS管理控制台。
- 在“告警管理”界面,查看集群最近7天的告警信息。
- 选择“集群 > 集群列表”,根据告警信息获取的集群信息,找到对应的集群。
- 单击集群名称,进入集群详情页面,在集群详情页面,单击“修改参数”,在参数列表右侧的搜索框搜索“max_connections”,修改该参数的值。 图1 修改参数
告警清除
此告警修复后,自动清除。
参考信息
不涉及。