MRS支持的基础监控指标
功能说明
云监控服务CES支持实时监控MRS集群的核心指标,方便用户掌握集群的指标信息,以便及时处理集群的异常状况。本文定义了MRS上报云监控服务的集群和节点监控指标的命名空间,监控指标列表和维度定义。用户可以通过云监控服务提供的管理控制台或API接口来检索云搜索服务产生的监控指标和告警信息。
云监控服务最大支持4个层级维度,维度编号从0开始,编号3为最深层级。例如监控指标中的维度信息为“cluster_id,node_id”时,表示对应的监控指标的维度存在层级关系,且“cluster_id”为0层,“node_id”为1层。
命名空间
SYS.MRS
基础监控指标列表
不同版本MRS集群所包含的组件及支持的监控指标列表可能存在不同,用户也可以通过云监控服务的指标与事件中心,查看各云服务的相关指标参数。
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| ck_concurrency_query | ClickHouseServer并发数 | 节点上并发执行的任务数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ck_disks_local | ClickHouse本地盘使用量 | ClickHouse本地盘使用量。 | ≥ 0 | Byte/s | 1024 | cluster_id,node_id,role_name | 5分钟 |
| ck_disks_obs | ClickHouse OBS使用量 | ClickHouse OBS使用量。 | ≥ 0 | Byte/s | 1024 | cluster_id,node_id,role_name | 5分钟 |
| ck_system_detached_parts | ClickHouse MergeTree表被分离的数据容量 | 此指标反映了MergeTree表被分离的数据容量。 | ≥ 0 | GiB/s | 1024 | cluster_id,node_id,role_name | 5分钟 |
| ck_system_detached_parts_allhost | ClickHouse集群中MergeTree表被分离的数据容量 | 此指标反映了集群中MergeTree表被分离的数据容量。 | ≥ 0 | GiB/s | 1024 | cluster_id,service_name | 5分钟 |
| ck_system_metrics_mysqlConnection | ClickHouse MYSQL连接数 | MYSQL连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ck_system_metrics_mysqlConnection_allhost | ClickHouse集群MYSQL连接数 | 集群MYSQL连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| ck_system_replication_queue_get_part | ClickHouse副本队列中的GET_PART任务数量 | 此指标反映了副本队列中的GET_PART任务数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ck_system_replication_queue_get_part_allhost | ClickHouse集群中副本队列中的GET_PART任务数量 | 此指标反映了集群中副本队列中的GET_PART任务数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| ck_system_replication_queue_merge_parts | ClickHouseServer副本队列中的MERGE_PARTS任务数量 | 此指标反映了副本队列中的MERGE_PARTS任务数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ck_system_replication_queue_merge_parts_allhost | ClickHouse集群中副本队列中的MERGE_PARTS任务数量 | 此指标反映了集群中副本队列中的MERGE_PARTS任务数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| ck_system_replication_queue_mutate_part | ClickHouseServer副本队列中的MUTATE_PART任务数量 | 此指标反映了副本队列中的MUTATE_PART任务数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ck_system_replication_queue_mutate_part_allhost | ClickHouse集群中副本队列中的MUTATE_PART任务数量 | 此指标反映了集群中副本队列中的MUTATE_PART任务数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| doris_fe_cpu_usage | Doris FE的CPU使用率 | Doris FE的CPU使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_mem | Doris FE内存使用情况 | Doris FE使用的内存。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_image_write_failed | Doris FE生成元数据镜像文件失败的次数 | Doris FE生成元数据镜像文件失败的次数,不应失败,如失败,需人工介入,不失败时不上报。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_max_journal_id | Doris当前FE节点最大元数据日志ID | Doris当前FE节点最大元数据日志ID。如果是Master FE,则是当前写入的最大ID,如果是非Master FE,则代表当前回放的元数据日志最大ID,用于观察多个FE之间的 id 是否差距过大。过大则表示元数据同步出现问题。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_qps | Doris当前FE每秒查询数量(仅统计查询请求) | Doris FE的QPS。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_report_queue_size | Doris BE的各种定期汇报任务在FE端的队列长度 | Doris BE的各种定期汇报任务在FE端的队列长度,该值反映了汇报任务在 Master FE 节点上的阻塞程度,数值越大,表示FE处理能力不足。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_rps | Doris当前FE每秒请求数量(包含查询以及其他各类语句) | Doris当前FE每秒请求数量(包含查询以及其他各类语句),和 QPS 配合来查看集群处理请求的量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_scheduled_tablet_num_allhost | Doris所有FE节点正在调度的 tablet 数量 | Doris的所有 FE节点正在调度的tablet 数量,该数值可以反映当前集群,正在迁移的 tablet 数量。如果长时间有值,说明集群不稳定。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| doris_fe_tablet_num | Doris 各个BE节点当前tablet总数 | Doris各个BE节点当前tablet总数,可以查看tablet分布是否均匀以及绝对值是否合理。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_jvm_thread | Doris BE JVM 线程数统计 | Doris FE的JVM 线程数统计,可以观测JVM 线程数是否合理。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_cpu_usage | Doris BE的CPU使用率 | Doris BE的CPU使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_mem | Doris BE内存使用情况 | Doris BE内存使用情况。 | ≥ 0 | KiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_cache_usage | Doris BE指定LRU Cache的使用量 | Doris BE指定LRU Cache的使用量,用于观测内存占用情况。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_engine_requests_failed_total | Doris BE各类型的任务的失败次数的累计值 | Doris BE各类型的任务的失败次数的累计值。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_engine_requests_total | Doris BE各类型的任务的总次数的累计值 | Doris BE各类型的任务的总次数的累计值。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_process_thread_num | Doris BE进程线程数 | Doris BE通过/proc/pid/task采集。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_fragment_thread_pool_queue_size | Doris BE当前查询执行线程池等待队列的长度 | Doris BE当前查询执行线程池等待队列的长度,如果大于零,则说明查询线程已耗尽,查询会出现堆积,为0时不上报。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_image_clean_failed | Doris FE清理历史元数据镜像文件失败的次数 | Doris FE清理历史元数据镜像文件失败的次数,不应失败,如失败,需人工介入,不失败时不上报。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_mem_per | Doris FE的内存使用率 | Doris FE的内存使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_mem_per | Doris BE的内存使用率 | Doris BE的内存使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_mysql_thread_pool | Doris FE中处理任务的线程池情况 | Doris FE中处理任务的线程池情况。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_thread_pool | Doris FE中和BE交互的线程池情况 | Doris FE中和BE交互的线程池情况。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_max_tablet_compaction_score | Doris 所有BE节点中最大的compaction score值 | Doris所有BE节点中最大的compaction score值。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| doris_fe_thrift_rpc_latency_ms | Doris FE thrift接口各个方法接收的RPC请求耗时 | Doris FE thrift接口各个方法接收的RPC请求耗时。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| system_meminfo | Doris FE节点机器的内存监控 | Doris FE节点机器的内存监控。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_query_err | Doris FE错误查询的累积值 | Doris FE错误查询的累积值。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_query_err_allhost | Doris 所有FE节点的错误查询的累积值 | Doris所有 FE错误查询的累积值。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| doris_fe_query_err_rate | Doris FE每秒错误查询数 | Doris FE每秒错误查询数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_query_err_rate_allhost | Doris 所有FE节点的每秒错误查询数 | Doris所有FE每秒错误查询数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| doris_fe_txn_status | Doris FE当前处于各个状态的导入事务的数量 | Doris FE当前处于各个状态的导入事务的数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| doris_be_snmp_tcp | Doris BE tcp包发送和接收情况 | Doris BE tcp包发送和接收情况。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_disks_state | Doris BE指定数据目录的磁盘状态 | Doris BE指定数据目录的磁盘状态。1表示正常。0表示异常。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_cache_usage_ratio | Doris BE记录指定LRU Cache的使用率 | Doris BE用于观测内存占用情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_cache_lookup_count | Doris BE记录指定LRU Cache被查找的次数 | Doris BE记录指定LRU Cache被查找的次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_cache_hit_count | Doris BE记录指定LRU Cache的命中次数 | Doris BE记录指定LRU Cache的命中次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_cache_hit_ratio | Doris BE记录指定LRU Cache的命中率 | Doris BE记录指定LRU Cache的命中率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_cache_capacity | Doris BE记录指定LRU Cache的容量 | Doris BE记录指定LRU Cache的容量。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_load_channel_count | Doris BE当前打开的load channel个数 | Doris BE当前打开的load channel个数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_disks_compaction_num | Doris BE指定数据目录上正在执行的compaction任务数 | Doris BE指定数据目录上正在执行的compaction任务数。如{path="/path1/"}表示/path1目录上正在执行的任务数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_disks_local_used_capacity | Doris BE指定数据目录所在磁盘的本地已使用空间 | Doris BE指定数据目录所在磁盘的本地已使用空间。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_disks_remote_used_capacity | Doris BE指定数据目录所在磁盘的对应的远端目录的已使用空间 | Doris BE指定数据目录所在磁盘的对应的远端目录的已使用空间。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_cpu | Doris BE CPU相关监控指标 | Doris BE的CPU相关监控指标,从/proc/stat采集。 | ≥ 0 | jiffies | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_disks_total_capacity | Doris BE指定数据目录所在磁盘的总容量 | Doris BE指定数据目录所在磁盘的总容量。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_disks_avail_capacity | Doris BE指定数据目录所在磁盘的剩余空间 | Doris BE指定数据目录所在磁盘的剩余空间。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_thread_pool_queue | Doris FE中和BE交互的线程池中正在排队的任务数 | Doris FE中和BE交互的线程池中正在排队的任务数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_mysql_thread_pool_queue | Doris FE中处理任务的线程池中正在排队的任务数 | Doris FE中处理任务的线程池中正在排队的任务数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_used_memory_ratio | Doris FE节点使用的内存比率 | Doris FE节点使用的内存比率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_heap_mem_used_ratio | Doris FE节点堆内存的使用率 | Doris FE节点堆内存的使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_fragment_queue_size_alarm | Doris BE当前查询执行线程池等待队列的长度 | Doris BE当前查询执行线程池等待队列的长度,如果大于零,则说明查询线程已耗尽,查询会出现堆积,为0时不上报。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_snmp_tcp_in_errs_ratio | Doris BE tcp包接收错误的次数的比率 | Doris BE的tcp包接收错误的次数的比率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_disks_used_capacity_ratio | Doris BE数据盘的使用率 | Doris BE数据盘的使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_max_mem_relationship_available_mem | Doris BE最大内存与机器剩余内存的关系 | Doris BE最大内存与机器剩余内存的关系。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_failed_tasks_total | Doris BE是否存在某种类型的任务的失败的次数有增长趋势 | Doris BE是否存在某种类型的任务的失败的次数有增长趋势。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| fe_status | Doris FE实例的状态 | Doris FE实例的状态。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| be_status | Doris BE实例的状态 | Doris BE实例的状态。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_connection_total_ratio | Doris FE的MySQL端口连接数的比例 | Doris FE的MySQL端口连接数的比例,用于监控查询连接数的比例。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_tenant_concurrency_query_num_sum | Doris 租户查询并发数总和 | 统计Doris每个租户下的所有FE节点的查询并发数,并求和。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| doris_be_tenant_memory_usage_avg | Doris 租户内存使用大小平均值 | 统计Doris每个租户下的所有BE节点的内存使用大小,并取平均值。 | ≥ 0 | MiB | 1024 | cluster_id,service_name | 5分钟 |
| doris_be_tenant_cpu_usage_avg | Doris 租户CPU占用率平均值 | 统计Doris每个租户下的所有BE节点的CPU占用率并取平均值。 | 0.00-100.00% | % | 不涉及 | cluster_id,service_name | 5分钟 |
| doris_fe_tenant_concurrency_query_num_alarm | Doris 租户查询并行数超过阈值 | Doris租户查询并行数超过阈值。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_tenant_memory_usage_alarm | Doris 租户内存使用率超过阈值 | Doris租户内存使用率超过阈值。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_hot_cold_table_num | Doris FE冷热数据表数量统计 | Doris FE用于查看冷热数据表分布是否均匀以及绝对值是否合理。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_hot_cold_table_percent | Doris FE冷热数据表的占比统计 | Doris FE冷热数据表的占比统计。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_cold_data_volume | Doris BE冷数据大小统计 | Doris BE用于查看冷数据分布是否均匀以及绝对值是否合理。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_cold_data_volume_percent | Doris BE冷数据占比统计 | Doris BE冷数据占比统计。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_cold_data_query_percent | Doris FE冷数据查询的占比统计 | Doris FE冷数据查询的占比统计。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_data_get_cold_per_second_volume | Doris BE每秒转冷的数据大小统计 | Doris BE每秒转冷的数据大小统计。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_obs_availability_alarm | Doris 冷热分离FE连接OBS不可用告警 | Doris FE冷热分离FE连接OBS不可用告警。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_tenant_concurrency_query_num | Doris FE租户查询并发数 | Doris FE统计所有租户单个FE节点的查询并发数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_tenant_memory_usage | Doris BE租户内存使用大小 | Doris BE统计所有租户单个BE节点的内存使用大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_tenant_cpu_usage | Doris BE租户CPU占用率 | Doris BE统计所有租户单个BE节点的CPU使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_stream_load_txn_request | Doris BE Stream Load任务情况统计 | Doris BE Stream Load任务情况统计。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_light_work_threads_pools | Doris BE brpc light线程池情况统计 | Doris BE brpc light线程池情况统计。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_be_heavy_work_threads_pools | Doris BE brpc heavy线程池情况统计 | Doris BE brpc heavy线程池情况统计。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_sql_defender_metric | Doris FE大Sql拦截统计 | Doris FE统计所有被拦截的大SQL数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| doris_fe_publish_version_queue_size | Doris FE统计执行publishVersion任务的队列大小 | Doris FE统计执行publishVersion任务的队列大小。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| token_server_directmemory_calculate | Guardian TokenServer直接内存使用率 | Guardian TokenServer直接内存使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| token_server_directmemory_max | Guardian TokenServer设定的最大直接内存大小 | Guardian TokenServer设定的最大直接内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| token_server_directmemory_used | Guardian TokenServer使用的直接内存大小 | Guardian TokenServer使用的直接内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| token_server_heapmemory_calculate | Guardian TokenServer堆内存使用率 | Guardian TokenServer 进程堆内存使用百分比统计。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| token_server_heapmemory_max | Guardian TokenServer设定的最大堆内存大小 | Guardian TokenServer进程可用的最大堆内存。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| token_server_heapmemory_used | Guardian TokenServer使用的堆内存大小 | Guardian TokenServer进程使用的堆内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| token_server_nonheapmemory_calculate | Guardian TokenServer非堆内存使用率 | Guardian TokenServer进程非堆内存使用百分比统计。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| token_server_nonheapmemory_max | Guardian TokenServer设定的最大非堆内存大小 | Guardian TokenServer进程可用的最大非堆内存。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| token_server_nonheapmemory_used | Guardian TokenServer使用的非堆内存大小 | Guardian TokenServer进程使用的非堆内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| token_server_request_iam_interface_count | Guardian TokenServer 请求IAM的次数 | Guardian TokenServer 请求IAM的次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| token_server_sts_interface_received_request_count | Guardian TokenServer STS接口收到的请求次数 | Guardian TokenServer STS接口收到的请求次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| pqs_connection_used_rate | HBase PhoenixQueryServer的连接使用率 | HBase PhoenixQueryServer的连接使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_cpu_core_num | HBase PhoenixQueryServer的CPU核数 | HBase PhoenixQueryServer的CPU核数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_cpu_usage_calculate | HBase PhoenixQueryServer的CPU统计 | HBase PhoenixQueryServer的CPU统计。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_cpu_used | HBase PhoenixQueryServer的CPU使用率 | HBase PhoenixQueryServer的CPU使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_direct_memory_used_calculate | HBase PhoenixQueryServer直接内存使用率统计 | HBase PhoenixQueryServer直接内存使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_directmemMax | HBase PhoenixQueryServer分配的直接内存大小 | HBase PhoenixQueryServer分配的直接内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| pqs_directmemUsed | HBase PhoenixQueryServer使用的直接内存大小 | HBase PhoenixQueryServer使用的直接内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| pqs_gcCount | HBase PhoenixQueryServer的总GC次数 | HBase PhoenixQueryServer的总GC次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_gcTimeMillis | HBase PhoenixQueryServer的总GC时间 | HBase PhoenixQueryServer的总GC时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_gcTimeMillisParNew | HBase PhoenixQueryServer的GC中回收young区所花时长 | HBase PhoenixQueryServer的GC中回收young区所花时长。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_gcTimeMillisParOld | HBase PhoenixQueryServer的GC中回收old区所花时长 | HBase PhoenixQueryServer的GC中回收old区所花时长。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_heap_memory_used_calculate | HBase PhoenixQueryServer堆内存使用率统计 | HBase PhoenixQueryServer堆内存使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_mem_usage | HBase PhoenixQueryServer内存统计 | HBase PhoenixQueryServer内存统计。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| pqs_memheapcommittedm | HBase PhoenixQueryServer分配的堆内存大小 | HBase PhoenixQueryServer分配的堆内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| pqs_memheapusedm | HBase PhoenixQueryServer使用的堆内存大小 | HBase PhoenixQueryServer使用的堆内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| pqs_memnonheapcommittedm | HBase PhoenixQueryServer分配的非堆内存大小 | HBase PhoenixQueryServer分配的非堆内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| pqs_memnonheapusedm | HBase PhoenixQueryServer使用的非堆内存大小 | HBase PhoenixQueryServer使用的非堆内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| pqs_numOpenConnections | HBase PhoenixQueryServer连接打开的数量 | HBase PhoenixQueryServer连接打开数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_threadsblocked | HBase PhoenixQueryServer处于Blocked状态的线程数 | HBase PhoenixQueryServer处于Blocked状态的线程数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_threadsnew | HBase PhoenixQueryServer处于New状态的线程数 | HBase PhoenixQueryServer处于New状态的线程数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_threadsrunnable | HBase PhoenixQueryServer处于Runnable状态的线程数 | HBase PhoenixQueryServer处于Runnable状态的线程数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_threadsterminated | HBase PhoenixQueryServer处于Terminated状态的线程数 | HBase PhoenixQueryServer处于Terminated状态的线程数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| pqs_threadswaiting | HBase PhoenixQueryServer处于Waiting状态的线程数 | HBase PhoenixQueryServer处于Waiting状态的线程数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_pread_time_999th_percentile | HBase RegionServer中P999 Pread耗时 | HBase RegionServer中Pread耗时的第999百分位数。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_pread_time_99th_percentile | HBase RegionServer中P99 Pread耗时 | HBase RegionServer中Pread耗时的第99百分位数。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_pread_time_max | HBase RegionServer中Pread最大耗时 | HBase RegionServer中Pread最大耗时。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_pread_time_max_allhost | HBase RegionServer中Pread最大耗时 | HBase RegionServer中Pread最大耗时。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_pread_time_max_allhost_calculate | HBase RegionServer中Pread最大耗时 | HBase RegionServer中Pread最大耗时。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_read_time_999th_percentile | HBase RegionServer中P999 Read耗时 | HBase RegionServer中Read耗时的第999百分位数。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_read_time_99th_percentile | HBase RegionServer中P99 Read耗时 | HBase RegionServer中Read耗时的第99百分位数。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_read_time_max | HBase RegionServer中Read最大耗时 | HBase RegionServer中Read最大耗时。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_read_time_max_allhost | HBase RegionServer中Read最大耗时 | HBase RegionServer中Read最大耗时。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_read_time_max_allhost_calculate | HBase RegionServer中Read最大耗时 | HBase RegionServer中Read最大耗时。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_write_time_999th_percentile | HBase RegionServer中P999 Write耗时 | HBase RegionServer中Write耗时的第999百分位数。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_write_time_99th_percentile | HBase RegionServer中P99 Write耗时 | HBase RegionServer中Write耗时的第99百分位数。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_write_time_max | HBase RegionServer中Write最大耗时 | HBase RegionServer中Write最大耗时。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_write_time_max_allhost | HBase RegionServer中Write最大耗时 | HBase RegionServer中Write最大耗时。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_fs_write_time_max_allhost_calculate | HBase RegionServer中Write最大耗时 | HBase RegionServer中Write最大耗时。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_numCallsInReadQueue | HBase RegionServer中RPC读队列数 | HBase RegionServer中RPC读队列数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_numCallsInWriteQueue | HBase RegionServer中RPC写队列数 | HBase RegionServer中RPC写队列数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rs_slowWalSyncCount | HBase RegionServer中WAL写入超时个数 | HBase RegionServer中WAL写入超时个数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| dn_readblockopavgtime | HDFS DataNode执行ReadBlock操作的平均时间 | HDFS文件系统中DataNode执行ReadBlock操作的平均时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| dn_slowacktoupstream_speed | HDFS DataNode每秒出现慢AckToUpstream的次数 | HDFS文件系统中DataNode每秒出现慢AckToUpstream的次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| dn_slowflushorsync_speed | HDFS DataNode每秒出现慢Flush或Sync的次数 | HDFS文件系统中DataNode 每秒出现慢Flush或Sync的次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| dn_slowsyncwriteroscache_speed | HDFS DataNode每秒出现慢SyncWriterOsCache的次数 | HDFS文件系统中DataNode每秒出现慢SyncWriterOsCache的次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| dn_slowwritedatatodisk_speed | HDFS DataNode每秒出现慢WriteDataToDisk的次数 | HDFS文件系统中DataNode每秒出现慢WriteDataToDisk的次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| dn_slowwritepackettodownstream_speed | HDFS DataNode每秒出现慢WritePacketToDownStream的次数 | HDFS文件系统中DataNode每秒出现慢WritePacketToDownStream的次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| dn_writeblockopavgtime | HDFS DataNode执行WriteBlock操作的平均时间 | HDFS文件系统中DataNode执行WriteBlock操作的平均时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| dn_xceivercount | HDFS DataNode接收数据的连接数 | HDFS文件系统中DataNode接收数据的连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| nn_rpc_queuetime_numops_default | HDFS RPC调用总数 | HDFS文件系统中每秒RPC调用总数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| qas_cpuusage | HetuEngine QAS进程使用的CPU统计 | HetuEngine QAS进程使用的CPU统计。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| qas_disk_usage | HetuEngine QAS磁盘使用率 | HetuEngine QAS磁盘使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| qas_gc_time | HetuEngine QAS进程的GC时间统计 | HetuEngine QAS进程的GC时间统计。 | ≥ 0 | s | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| qas_memusage | HetuEngine QAS进程使用的内存统计 | HetuEngine QAS进程使用的内存统计。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| hs_close_connect_duration | Hive HiveServer关闭连接的耗时 | HiveServer关闭连接所执行的时长。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| hs_establish_connect_duration | Hive HiveServer建立连接的耗时 | HiveServer建立连接所执行的时长。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| hs_failedhqlnum | Hive HiveServer执行失败的HQL命令数 | Hive执行失败的HQL命令数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| hs_mean_compile_time | Hive HiveServer的HQL平均编译时间 | Hive的HQL平均编译时间。 | ≥ 0 | s | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| hs_mean_execute_time | Hive HiveServer的HQL平均执行时间 | Hive的HQL平均执行时间。 | ≥ 0 | s | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| hs_mean_sql_time | Hive HiveServer的HQL平均完成时间 | Hive的HQL平均完成时间。 | ≥ 0 | s | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| hs_scan_parts_num | Hive HiveServer的扫描分区数 | HiveServer的扫描分区数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_api_create_table_db_75th | Hive MetaStore建表时元数据库第75百分位数的执行时间 | 创建表时MetaStore调底层数据库api中,75%都小于此时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_api_create_table_db_99th | Hive MetaStore建表时元数据库第99百分位数的执行时间 | 创建表时MetaStore调底层数据库api中,99%都小于此时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_api_create_table_db_max | Hive MetaStore建表时元数据库最长执行时间 | 创建表时MetaStore调底层数据库api中的最大时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_api_create_table_db_mean | Hive MetaStore建表时元数据库平均执行时间 | 创建表时MetaStore调底层数据库api的平均时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_api_create_table_db_min | Hive MetaStore建表时元数据库最短执行时间 | 创建表时MetaStore调底层数据库api中的最短时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_api_get_database_75th | Hive MetaStore查询库时第75百分位数的执行时间 | MetaStore执行的所有get_database api中,75%都小于此时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_api_get_database_99th | Hive MetaStore查询库时第99百分位数的执行时间 | MetaStore执行的所有get_database api中,99%都小于此时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_api_get_database_max | Hive MetaStore get_database api最长执行时间 | MetaStore执行的get_database api中的最大时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_api_get_database_mean | Hive MetaStore get_database api平均执行时间 | MetaStore执行的get_database api的平均时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_api_get_database_min | Hive MetaStore get_database api最短执行时间 | MetaStore执行的get_database api中的最短时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_close_connect_duration | Hive MetaStore关闭连接的耗时 | MetaStore关闭连接所执行的时长。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_establish_connect_duration | Hive MetaStore建立连接的耗时 | MetaStore建立连接所执行的时长。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_host_session_map | Hive连接到MetaStore的客户端session数量 | 连接到MetaStore的客户端session数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_last_5_minute_mean_create_table_time | Hive MetaStore最近5分钟建表时元数据库平均执行时间 | MetaStore执行的当前时间前5分钟所有create_table API元数据操作的平均时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ms_user_session_group | Hive连接到MetaStore的用户session数量 | 连接到MetaStore的用户session数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| catalog_cpuusage | Impala Catalog进程的CPU占用率 | Impala Catalog进程的CPU占用率统计,监控Catalogd进程占用的服务器CPU资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| catalog_gc_times | Impala Catalog 周期内GC次数 | Impala 周期内不同时长的GC次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| catalog_gc_times_exceeds_1s | Impala Catalog 总GC次数 | Impala 不同时长的GC次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| catalog_jvm_sleep_time | Impala Catalog GC时间 | Impala 由于GC引起的JVM暂停时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| catalog_memusage | Impala Catalog进程的内存占用率 | Impala Catalog进程的内存占用率统计,监控Catalog进程占用的服务器内存资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| impala_thrift_server_beeswax_frontend_total_connections | Impala Beeswax接口连接总数 | Impala 在Impala Daemon的运行期间,与Beeswax的连接总数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| impala_thrift_server_hiveserver2_frontend_connection_setup_queue_size | Impala 已接受并等待设置的的HiveServer2 API连接数-所有实例 | Impala 此Impala Daemon上已接受并等待设置的的HiveServer2 API连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| impala_thrift_server_hiveserver2_frontend_connections_in_use | Impala 处于活动状态的HiveServer2 API连接数-所有实例 | Impala 此Impala Daemon上处于活动状态的HiveServer2 API连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| impala_thrift_server_hiveserver2_frontend_total_connections | Impala HiveServer2接口连接总数-所有实例 | Impala 在Impala Daemon的运行期间,与HiveServer2 API连接的总数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| impala_thrift_server_hiveserver2_http_frontend_connection_setup_queue_size | Impala 已接受并等待设置的的HiveServer2 HTTP API连接数-所有实例 | Impala 此Impala Daemon上已接受并等待设置的的HiveServer2 HTTP API连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| impala_thrift_server_hiveserver2_http_frontend_connections_in_use | Impala 处于活动状态的HiveServer2 HTTP API连接数-所有实例 | Impala 此Impala Daemon上处于活动状态的HiveServer2 HTTP API连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| impala_thrift_server_hiveserver2_http_frontend_total_connections | Impala HiveServer2连接数 | Impala HiveServer2连接数统计。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| impalad_cpuusage | Impala Impalad进程的CPU占用率 | Impala Impalad进程的CPU占用率统计,监控Impalad进程占用的服务器CPU资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| impalad_gc_times | Impala Impalad 周期内GC次数 | Impala 周期内不同时长的GC次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| impalad_gc_times_exceeds_1s | Impala Impalad 总GC次数 | Impala 不同时长的GC次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| impalad_jdbc_number | Impala 已经连接到Impalad进程的JDBC数量 | Impala 连接到Impalad进程的JDBC连接数统计,监控JDBC客户端与Impalad进程的连接情况。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| impalad_jvm_sleep_time | Impala Impalad GC时间 | Impala 由于GC引起的JVM暂停时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| impalad_memusage | Impala Impalad进程的内存占用率 | Impala Impalad进程的内存占用率统计,监控Impalad进程占用的服务器内存资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| impalad_odbc_number | Impala 已经连接到Impalad进程的ODBC数量 | Impala 连接到Impalad进程的ODBC连接数统计,监控ODBC客户端与Impalad进程的连接情况。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| memory_mapped_bytes | Impala Impalad进程的虚拟内存大小-所有实例 | Impala Impalad进程中内存映射的总字节数(虚拟内存大小)。 | ≥ 0 | MiB | 1024 | cluster_id,service_name | 5分钟 |
| memory_rss | Impala Impalad进程的物理内存大小 | Impala Impalad进程的的RSS,包括TCMalloc、缓冲池和Jvm。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| num_executing_queries | Impala 执行中的查询数 | Impala 执行中的查询数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| num_in_flight_queries | Impala 提交中的查询数-所有实例 | Impala 提交中的查询数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| num_in_flight_queries_allhost | Impala 查询任务总数统计 | Impala 查询任务总数统计。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| num_waiting_queries | Impala 等待中的查询数-所有实例 | Impala 等待中的查询数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| js_cpu_usage | JobServer进程CPU使用率 | JobServer的CPU统计,监控JobServer进程占用的服务器CPU资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_gc_fgc_usage | JobServer FULL GC次数 | JobServer FULL GC次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_gc_old_usage | JobServer老年代使用内存占比 | JobServer老年代使用内存占比。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_memory_per_usage | JobServer进程内存使用率 | JobServer进程使用内存统计,监控JobServer进程占用的服务器内存资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_memory_usage | JobServer使用的直接内存大小 | JobServer使用的内存大小统计。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| js_metrics_events_active_job | JobServer正在执行的任务数 | JobServer正在执行的任务数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_metrics_events_active_job_allhost | JobServer集群正在执行的任务数 | JobServer集群正在执行的任务数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| js_metrics_events_active_nginx_connect | JobBalancer连接数 | JobBalancer正在处理的连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_metrics_events_active_nginx_connect_allhost | JobBalancer集群正在处理的连接数 | JobBalancer集群连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| js_metrics_events_kill_delay | JobServer终止作业接口时延 | JobServer终止作业接口时延。 | ≥ 0 | s | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_metrics_events_kill_failure_rate | JobServer终止作业接口失败率 | JobServer终止作业接口失败率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_metrics_events_query_delay | JobServer查询作业接口时延 | JobServer查询作业接口时延。 | ≥ 0 | s | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_metrics_events_query_failure_rate | JobServer查询作业接口失败率 | JobServer查询作业接口失败率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_metrics_events_submit_delay | JobServer提交作业接口时延 | JobServer提交作业接口时延。 | ≥ 0 | s | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_metrics_events_submit_failure_rate | JobServer提交作业接口失败率 | JobServer提交作业接口失败率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_metrics_events_wait_job | JobServer等待执行的任务数 | JobServer等待执行的任务数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_metrics_events_wait_job_allhost | JobServer集群等待执行的任务数 | JobServer集群等待执行的任务数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| bk_underreplicatedpartitions_allhost_percentage_calculate | Kafka未完全同步的Partition百分比 | Kafka集群中所有Broker上未完全同步的Partition数目总和占Partition总数的百分比。 | 0.00-100.00% | % | 不涉及 | cluster_id,service_name | 5分钟 |
| mm_cpuusage | MirrorMaker占用的CPU | MirrorMaker的CPU使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| mm_memusage | MirrorMaker占用的内存 | MirrorMaker使用的内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| kudu_data_dirs_full | KuduTserver容量已满磁盘数 | KuduTserver容量已满磁盘数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| tserver_mem_percentage_consumed | KuduTServer内存使用百分比 | KuduTServer内存使用百分比。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| tserver_tablet_leader_num | KuduTServer运行中的tablet leader数量 | KuduTServer运行中的tablet leader数量统计,监控各节点TServer均衡状态。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| tserver_tablet_leader_num_allhost | 集群所有KuduTServer运行中的tablet leader数量 | 集群所有KuduTServer运行中的tablet leader数量统计,监控Kudu集群的负载状态。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| tserver_tablet_num | KuduTServer运行中的tablet数量 | KuduTServer运行中的tablet数量统计。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| tserver_tablet_num_allhost | 集群所有KuduTServer运行中的tablet数量 | 集群所有KuduTServer运行中的tablet数量,监控Kudu集群的平均负载状态。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| ldms_cpuusage | LDMS LDMSSever CPU 统计 | LDMS LDMSSever的CPU使用情况统计。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ldms_memusage | LDMS LDMSSever进程内存统计 | LDMS LDMSSever进程的内存使用情况统计。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| dev_cpu_ni | MRS Manager 主机改变过优先级的进程占CPU的百分比 | MRS Manager 主机统计周期内操作系统改变过优先级的进程占用CPU时间的百分比。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_disk_r_await_per_second | MRS Manager 主机磁盘 每个读操作平均所需时间 | MRS Manager 主机磁盘 每个读操作平均所需时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,device_name | 5分钟 |
| dev_disk_w_await_per_second | MRS Manager 主机磁盘 每个写操作平均所需时间 | MRS Manager 主机磁盘 每个写操作平均所需时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,device_name | 5分钟 |
| dev_instance_process_memory_usage | MRS Manager 主机进程内存使用大小 | MRS Manager 主机组件实例进程和Manager进程的内存使用大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id | 5分钟 |
| dev_is_dstatus_process_ok | MRS Manager 主机 D状态和Z状态进程总数 | MRS Manager 主机 D状态和Z状态进程总数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_load_value | MRS Manager 主机单核CPU平均负载 | MRS Manager 主机单核CPU平均负载。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_mem_buffers | MRS Manager 主机内核缓存的内存总量 | MRS Manager 主机统计周期内主机内核缓存的内存总量信息。 | ≥ 0 | MiB | 1024 | cluster_id,node_id | 5分钟 |
| dev_mem_cached | MRS Manager 主机缓存内存大小 | MRS Manager 主机统计周期内主机缓存内存大小信息。 | ≥ 0 | MiB | 1024 | cluster_id,node_id | 5分钟 |
| dev_mem_shared | MRS Manager 主机共享内存大小 | MRS Manager 主机统计周期内主机共享内存大小信息。 | ≥ 0 | MiB | 1024 | cluster_id,node_id | 5分钟 |
| dev_net_host_read_errors | MRS Manager 主机网络读包错误数 | MRS Manager 主机的读包错误数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_host_read_frames | MRS Manager 主机网络数据包帧错误数 | MRS Manager 主机的数据包帧错误数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_host_write_collisions | MRS Manager 主机网络数据包冲突数 | MRS Manager 主机的数据包冲突数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_host_write_dropped | MRS Manager 主机网络写包丢包数 | MRS Manager 主机的写包丢包数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_host_write_errors | MRS Manager 主机网络写包错误数 | MRS Manager 主机的写包错误数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_read_bs_speed | MRS Manager 主机网口读速率 | MRS Manager 主机网口读速率。 | ≥ 0 | KiB/s | 1024 | cluster_id,node_id | 5分钟 |
| dev_net_read_errors | MRS Manager 主机读包错误数 | MRS Manager 主机读包错误数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_read_frames | MRS Manager 主机数据包帧错误数 | MRS Manager 主机数据包帧错误数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_read_throughput | MRS Manager 主机读吞吐率 | MRS Manager 主机读吞吐率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_write_collisions | MRS Manager 主机数据包冲突数 | MRS Manager 主机数据包冲突数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_write_dropped | MRS Manager 主机写包丢包数 | MRS Manager 主机写包丢包数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_write_dropped_ratio | MRS Manager 主机写包丢包率 | MRS Manager 主机写包丢包率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_write_errors | MRS Manager 主机写包错误数 | MRS Manager 主机写包错误数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_write_errors_ratio | MRS Manager 主机写包错误率 | MRS Manager 主机写包错误率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_net_write_throughput | MRS Manager 主机写吞吐率 | MRS Manager 主机写吞吐率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_node_agent_fgc_count | MRS Manager 主机NodeAgent Full GC次数 | MRS Manager 主机NodeAgent Full GC次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_semaphore_array_usage_rate | MRS Manager 主机信号量集使用率 | MRS Manager 主机统计周期内主机信号量集使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id | 5分钟 |
| dev_temp_port_usage | MRS Manager 主机TCP临时端口使用率 | MRS Manager 主机TCP临时端口使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id | 5分钟 |
| kadmind_connected | KerberosAdmin进程连接数 | KerberosAdmin进程连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| kadmind_cpuusage | KerberosAdmin CPU使用率 | KerberosAdmin CPU使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| kadmind_memusage | KerberosAdmin占用内存 | KerberosAdmin占用内存。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| krb5kdc_allreqs_avg | KerberosServer所有请求数 | KerberosServer所有请求数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| krb5kdc_asreqs_avg | KerberosServer AS请求数 | KerberosServer AS请求数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| krb5kdc_connected | KerberosServer进程连接数 | KerberosServer进程连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| krb5kdc_cpuusage | KerberosServer CPU使用率 | KerberosServer CPU使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| krb5kdc_memusage | KerberosServer占用内存 | KerberosServer占用内存。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| krb5kdc_tgsreqs_avg | KerberosServer TGS请求数 | KerberosServer TGS请求数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ldapserver_connected | SlapdServer进程连接数 | SlapdServer进程连接数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ldapserver_cpuusage | SlapdServer CPU使用率 | SlapdServer CPU使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ldapserver_memusage | SlapdServer内存使用大小 | SlapdServer内存使用大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| worker_cpuusage | MemArtsCC Worker进程CPU占用率 | MemArtsCC Worker进程的CPU占用率统计,监控Worker进程占用的服务器CPU资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_evict_shard_num_history_usage | MemArtsCC Worker进程历史淘汰的分片数量 | MemArtsCC Worker进程的历史淘汰的分片数量,监控Worker进程占用的历史淘汰的分片数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_evict_shard_size_history_usage | MemArtsCC Worker进程历史淘汰的分片大小 | MemArtsCC Worker进程的历史淘汰的分片大小,监控Worker进程占用的历史淘汰的分片大小。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| worker_latency_avg_usage | MemArtsCC Worker进程read请求平均时延 | MemArtsCC Worker进程的平均时延,监控Worker进程占用的平均时延。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_latency_max_usage | MemArtsCC Worker进程read请求最大时延 | MemArtsCC Worker进程的最大时延,监控Worker进程占用的最大时延。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_latency_min_usage | MemArtsCC Worker进程read请求最小时延 | MemArtsCC Worker进程的最小时延,监控Worker进程占用的最小时延。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_mem_percent | MemArtsCC Worker进程内存占用率 | MemArtsCC Worker进程的内存占用率统计,监控Worker进程占用的服务器内存资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_process_completed_load_tasks | MemArtsCC 历史load task数量 | MemArtsCC 历史load task数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_process_completed_load_tasks_allhost | MemArtsCC 集群的历史load task数量 | MemArtsCC 集群的历史load task数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| worker_process_hit_count_distribution_huge_usage_allhost | MemArtsCC 集群缓存分片命中次数分布 | MemArtsCC 集群缓存分片命中次数分布。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| worker_process_hit_count_distribution_large_usage | MemArtsCC 缓存分片命中次数分布 | MemArtsCC 缓存分片命中次数分布。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_process_obsfetch_effected_traffic_usage_calculate | MemArtsCC Worker进程OBS带宽消减率 | MemArtsCC Worker进程OBS带宽消减率:(开启MemArtsCC时OBSA从OBS读取的流量+开启MemArtsCC时MemArtsCC从OBS异步缓存的流量)/关闭MemArtsCC时OBSA从OBS读取的流量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_process_obsfetch_miss_traffic_usage | 开启MemArtsCC流量详情 | 开启MemArtsCC流量详情。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| worker_process_obsfetch_original_traffic_usage_allhost | 开启MemArtsCC前后读取OBS周期流量对比 | 开启MemArtsCC前后读取OBS周期流量对比。 | ≥ 0 | MiB | 1024 | cluster_id,service_name | 5分钟 |
| worker_process_obsfetch_wasted_traffic_usage | 开启MemArtsCC前后读取OBS周期流量对比 | 开启MemArtsCC前后读取OBS周期流量对比。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| worker_read_bandwidth_usage_allhost | MemArtsCC 集群读带宽 | MemArtsCC 集群读带宽统计。 | ≥ 0 | Byte/s | 1024 | cluster_id,service_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| store_client_proxy_handle_flush_message_avg_latency | MemArtsStore StoreClientProxy处理flush消息平均时延统计 | MemArtsStore StoreClientProxy处理flush消息平均时延统计,监控StoreClientProxy进程的运行状态。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_client_proxy_handle_write_message_avg_latency | MemArtsStore StoreClientProxy处理write消息平均时延统计 | MemArtsStore StoreClientProxy处理write消息平均时延统计,监控StoreClientProxy进程的运行状态。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_client_proxy_process_connections_to_worker | MemArtsStore StoreClientProxy连接StoreWorker的连接数统计 | MemArtsStore StoreClientProxy连接StoreWorker的连接数统计,监控StoreClientProxy进程占用的服务器网络资源情况。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_client_proxy_process_memory_used | MemArtsStore StoreClientProxy的内存占用量统计 | MemArtsStore StoreClientProxy的内存占用量统计,监控StoreClientProxy进程占用的服务器内存资源情况。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| store_client_proxy_socket_cpu_usage | MemArtsStore StoreClientProxy的CPU使用率统计 | MemArtsStore StoreClientProxy的CPU使用率统计,监控StoreClientProxy进程占用的服务器CPU资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_process_connections | MemArtsStore StoreMaster进程连接数 | MemArtsStore StoreMaster进程连接数,监控StoreMaster进程的连接情况。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_process_fds | MemArtsStore StoreMaster进程文件描述符的数量 | MemArtsStore StoreMaster进程的文件加载数统计,监控StoreMaster进程文件加载情况。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_process_memory | MemArtsStore StoreMaster进程内存占用量 | MemArtsStore StoreMaster进程的内存占用量统计,监控Master进程占用的服务器内存资源情况。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| store_master_process_store_handle_cpu | MemArtsStore StoreMaster进程CPU占用率 | MemArtsStore StoreMaster进程的CPU占用率统计,监控Master进程占用的服务器CPU资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_process_threads | MemArtsStore StoreMaster进程线程数 | MemArtsStore StoreMaster进程线程数统计,监控StoreMaster进程线程数统计。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_process_worker_sdk_connections_ratio | MemArtsStore StoreMaster SDK网络连接数占配置上限的百分比 | MemArtsStore StoreMaster SDK网络连接数占配置上限的百分比,监控StoreMaster进程资源使用情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_space_ratio_num_allhost | MemArtsStore 总容量水位 | MemArtsStore 总容量水位百分比,监控Store集群资源使用情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,service_name | 5分钟 |
| store_master_stop_remote_latency_max | MemArtsStore Master通知worker删除时延 | MemArtsStore StoreMaster通知worker删除时延,监控StoreMaster进程的运行状态。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_worker_process_fds_ratio | MemArtsStore StoreMaster fd使用数量占配置上限的百分比 | MemArtsStore StoreMaster fd使用数量占配置上限的百分比,监控StoreMaster进程资源使用情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_worker_routine_total_ratio | MemArtsStore StoreMaster进程协程占用率 | MemArtsStore StoreMaster进程协程占用率统计,监控StoreMaster进程协程资源使用情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_zk_read_iops | MemArtsStore StoreMaster每秒读取ZooKeeper的次数 | MemArtsStore StoreMaster每秒读取ZooKeeper的次数,用于观察分析StoreMaster访问ZooKeeper的负载和时延。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_zk_read_latency | MemArtsStore StoreMaster读取ZooKeeper的平均延迟 | MemArtsStore StoreMaster读取ZooKeeper的平均延迟,用于观察分析StoreMaster访问ZooKeeper的负载和时延。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_zk_write_iops | MemArtsStore StoreMaster每秒写入ZooKeeper的次数 | MemArtsStore StoreMaster每秒写入ZooKeeper的次数,用于观察分析StoreMaster访问ZooKeeper的负载和时延。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_master_zk_write_latency | MemArtsStore StoreMaster写入ZooKeeper的平均延迟 | MemArtsStore StoreMaster写入ZooKeeper的平均延迟,用于观察分析StoreMaster访问ZooKeeper的负载和时延。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_node_pool_disk_total | MemArtsStore StoreWorker节点硬盘容量 | MemArtsStore StoreWorker节点硬盘容量,监控StoreWorker节点使用容量空间情况。 | ≥ 0 | GiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| store_node_pool_disk_usage_calculate | MemArtsStore StoreWorker的硬盘空间使用率 | MemArtsStore StoreWorker的硬盘空间使用率,监控StoreWorker节点已用硬盘容量。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_sidecar_cpu_usage | MemArtsStore StoreSideCar进程CPU占用率 | MemArtsStore StoreSideCar进程的CPU占用率统计,监控StoreSideCar进程占用的服务器CPU资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_sidecar_mem_used | MemArtsStore StoreSideCar进程内存占用量 | MemArtsStore StoreSideCar进程的内存占用率统计,监控StoreSideCar进程占用的服务器内存资源情况。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_pool_current_mplog_water_level | MemArtsStore StoreWorker Pool当前mplog数量的使用水位 | MemArtsStore StoreWorker Pool当前mplog数量的使用水位,用于观察分析Pool的使用情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_pool_file_write_latency | MemArtsStore StoreWorker Pool平均操作文件延迟 | MemArtsStore StoreWorker Pool平均操作文件延迟,用于观察分析Pool的负载和处理时延。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_pool_mplog_delete_latency | MemArtsStore StoreWorker Pool操作mplog的平均延迟 | MemArtsStore StoreWorker Pool操作mplog的平均延迟,用于观察分析Pool的负载和处理时延。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_pool_mplog_relocate_num | MemArtsStore StoreWorker Pool周期内mplog逃生分配计数 | MemArtsStore StoreWorker Pool周期内mplog逃生分配计数,用于观察分析Pool的负载和处理时延。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_pool_mplog_timeout_free_num | MemArtsStore StoreWorker Pool周期内mplog超时释放计数 | MemArtsStore StoreWorker Pool周期内mplog超时释放计数,用于观察分析Pool的负载和处理时延。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_pool_task_schedule_latency | MemArtsStore StoreWorker Pool平均任务调度延迟 | MemArtsStore StoreWorker Pool平均任务调度延迟,用于观察分析Pool的负载和处理时延。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_process_connections | MemArtsStore StoreWorker进程连接数 | MemArtsStore StoreWorker进程连接数统计,监控StoreWorker进程的连接情况。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_process_cpu_usage_allhost | MemArtsStore StoreWorker集群的CPU占用率统计 | MemArtsStore StoreWorker集群的CPU占用率统计,监控StoreWorker进程占用的服务器CPU资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,service_name | 5分钟 |
| store_worker_process_fds | MemArtsStore StoreWorker进程文件描述符数量 | MemArtsStore StoreWorker进程的文件加载数统计,监控StoreWorker进程文件加载情况。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_process_memory_used | MemArtsStore StoreWorker进程内存占用量 | MemArtsStore StoreWorker进程的内存占用量统计,监控Worker进程占用的服务器内存资源情况。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_process_memory_used_allhost | MemArtsStore StoreWorker集群的内存占用量统计 | MemArtsStore StoreWorker进程的内存占用量统计,监控StoreWorker进程占用的服务器内存资源情况。 | ≥ 0 | MiB | 1024 | cluster_id,service_name | 5分钟 |
| store_worker_process_store_network_cpu_usage | MemArtsStore StoreWorker进程内业务线程CPU占用率 | MemArtsStore StoreWorker进程的CPU占用率统计,监控Worker进程占用的服务器CPU资源情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_process_worker_sdk_connections_ratio | MemArtsStore StoreWorker SDK网络连接数占配置上限的百分比 | MemArtsStore StoreWorker SDK网络连接数占配置上限的百分比,监控StoreWorker进程资源使用情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_read_flows | MemArtsStore StoreWorker读资源占比例 | MemArtsStore StoreWorker读资源占用比例,监控StoreWorker进程资源使用情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_read_iops | MemArtsStore StoreWorker每秒读取次数 | MemArtsStore StoreWorker每秒读取次数,观察StoreWorker的处理能力、负载特征等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_read_iops_allhost | MemArtsStore Store集群总计每秒读取次数 | MemArtsStore 集群总计每秒读取次数,观察StoreWorker的处理能力、负载特征等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| store_worker_read_latency_max | MemArtsStore StoreWorker读取延迟 | MemArtsStore StoreWorker读取延迟,观察StoreWorker的处理能力、负载特征等。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_sdk_read_first_latency_avg | MemArtsStore StoreWorker SDK端到端首次平均读取延迟 | MemArtsStore StoreWorker SDK端到端首次平均读取延迟,用于观察分析端到端的负载特征。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_sdk_read_iops | MemArtsStore StoreWorker SDK端到端每秒读取次数 | MemArtsStore StoreWorker SDK端到端每秒读取次数,用于观察分析端到端的负载特征。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_sdk_read_iops_allhost | MemArtsStore Store集群SDK每秒读取次数 | MemArtsStore Store集群SDK每秒读取次数,用于观察分析整个集群的端到端的负载特征。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| store_worker_sdk_write_iops | MemArtsStore StoreWorker SDK端到端每秒写入次数 | MemArtsStore StoreWorker SDK端到端每秒写入次数,用于观察分析端到端的负载特征。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_sdk_write_iops_allhost | MemArtsStore Store集群SDK每秒写入次数 | MemArtsStore 集群SDK每秒写入次数,用于观察分析整个集群的端到端的负载特征。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| store_worker_sdk_write_latency_avg | MemArtsStore StoreWorker SDK端到端平均写入延迟 | MemArtsStore StoreWorker SDK端到端平均写入延迟,用于观察分析端到端的负载特征。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_worker_process_fds_ratio | MemArtsStore StoreWorker fd使用数量占配置上限的百分比 | MemArtsStore StoreWorker fd使用数量占配置上限的百分比,监控StoreWorker进程资源使用情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_worker_routine_total_ration | MemArtsStore StoreWorker进程协程占用率 | MemArtsStore StoreWorker进程协程占用率统计,监控StoreWorker进程协程资源使用情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_write_flows | MemArtsStore StoreWorker写并发占用比例 | MemArtsStore StoreWorker写并发占用比例,监控StoreWorker进程资源使用情况。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_write_iops | MemArtsStore StoreWorker每秒写入次数 | MemArtsStore StoreWorker每秒写入次数,观察StoreWorker的处理能力、负载特征等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_write_iops_allhost | MemArtsStore Store集群总计每秒写入次数 | MemArtsStore 集群总计每秒写入次数,观察StoreWorker的处理能力、负载特征等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| store_worker_write_latency_avg | MemArtsStore StoreWorker写入延迟 | MemArtsStore StoreWorker写入延迟,观察StoreWorker的处理能力、负载特征等。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| store_worker_write_memory_flows | MemArtsStore StoreWorker写资源占用占流控阈值的比例 | MemArtsStore StoreWorker写内存占用比例,监控StoreWorker进程资源使用情况。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_kv_client_read_meta_iops | MemArtsStore KV 每秒读取次数 | MemArtsStore KV 每秒读取元数据次数,用于观察分析KV读取元数据的负载、处理时延等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_kv_client_read_meta_iops_allhost | MemArtsStore 集群KV总计每秒读元数据的次数 | MemArtsStore 集群KV总计每秒读元数据的次数,用于观察分析KV读元数据的负载、处理时延等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| worker_kv_client_read_meta_latency_max | MemArtsStore KV 读元数据延迟 | MemArtsStore KV 读取元数据最大延迟,用于观察分析KV读取元数据的负载、处理时延等。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_kv_client_write_meta_iops | MemArtsStore KV 每秒写元数据次数 | MemArtsStore KV 每秒写元数据次数,用于观察分析KV写元数据的负载、处理时延等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_kv_client_write_meta_iops_allhost | MemArtsStore 集群KV总计每秒写元数据的次数 | MemArtsStore 集群KV总计每秒写元数据的次数,用于观察分析KV写元数据的负载、处理时延等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| worker_kv_client_write_meta_latency_max | MemArtsStore KV 写元数据延迟 | MemArtsStore KV 写元数据延迟,用于观察分析KV写元数据的负载、处理时延等。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_kv_sdk_append_bandwidth | MemArtsStore KV SDK写入带宽 | MemArtsStore KV SDK写入带宽,用于观察分析KV SDK节点的负载、处理时延等。 | ≥ 0 | Byte/s | 1024 | cluster_id,node_id,role_name | 5分钟 |
| worker_kv_sdk_append_iops | MemArtsStore KV SDK每秒写入次数 | MemArtsStore KV SDK每秒写入次数,用于观察分析KV SDK节点的负载、处理时延等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_kv_sdk_append_iops_allhost | MemArtsStore 集群KV SDK总计每秒写次数 | MemArtsStore 集群KV SDK 总计每秒写次数,用于观察分析StoreWorker节点的负载、处理时延等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| worker_kv_sdk_append_latency_avg | MemArtsStore KV SDK写入延迟 | MemArtsStore KV SDK写入延迟,用于观察分析KV SDK节点的负载、处理时延等。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_kv_sdk_read_bandwidth | MemArtsStore KV SDK读取带宽 | MemArtsStore KV SDK读取带宽,用于观察分析KV SDK节点的负载、处理时延等。 | ≥ 0 | Byte/s | 1024 | cluster_id,node_id,role_name | 5分钟 |
| worker_kv_sdk_read_iops | MemArtsStore KV SDK每秒读取次数 | MemArtsStore KV SDK每秒读取次数,用于观察分析KV SDK节点的负载、处理时延等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| worker_kv_sdk_read_iops_allhost | MemArtsStore 集群KV SDK总计每秒读取次数 | MemArtsStore 集群KV SDK总计每秒读取次数,用于观察分析StoreWorker节点的负载、处理时延等。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name | 5分钟 |
| worker_kv_sdk_read_latency_avg | MemArtsStore KV SDK读取延迟 | MemArtsStore KV SDK读取延迟,用于观察分析KV SDK节点的负载、处理时延等。 | ≥ 0 | µs | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| kms_latencyusage | Ranger RangerKMS请求时延 | Ranger RangerKMS请求时延。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ps_cpuusage | Ranger PolicySync CPU使用率 | Ranger PolicySync CPU使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ps_directmemory_calculate | Ranger PolicySync直接内存使用率 | Ranger PolicySync直接内存使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ps_directmemory_max | Ranger PolicySync设定的最大直接内存大小 | Ranger PolicySync设定的最大直接内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| ps_directmemory_used | Ranger PolicySync使用的直接内存大小 | Ranger PolicySync使用的直接内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| ps_gc_old_time | Ranger PolicySync垃圾回收(GC)old区时 | Ranger PolicySync垃圾回收(GC)old区时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ps_gc_time_calculate | Ranger PolicySync垃圾回收(GC)时间 | Ranger PolicySync垃圾回收(GC)时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ps_gc_young_time | Ranger PolicySync垃圾回收(GC)young区时间 | Ranger PolicySync中TagSync垃圾回收(GC)young区时间。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ps_heapmemory_calculate | Ranger PolicySync堆内存使用率 | Ranger PolicySync 进程堆内存使用百分比统计。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ps_heapmemory_max | Ranger PolicySync设定的最大堆内存大小 | Ranger PolicySync进程可用的最大堆内存。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| ps_heapmemory_used | Ranger PolicySync使用的堆内存大小 | Ranger PolicySync进程使用的堆内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| ps_memusage | Ranger PolicySync内存使用大小 | Ranger PolicySync内存使用大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| ps_nonheapmemory_calculate | Ranger PolicySync非堆内存使用率 | Ranger PolicySync进程非堆内存使用百分比统计。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| ps_nonheapmemory_max | Ranger PolicySync设定的最大非堆内存大小 | Ranger PolicySync中TagSync进程可用的最大非堆内存。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| ps_nonheapmemory_used | Ranger PolicySync使用的非堆内存大小 | Ranger PolicySync进程使用的非堆内存大小。 | ≥ 0 | MiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| ra_latencyusage | Ranger RangerAdmin请求时延 | Ranger RangerAdmin请求时延。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| jh_gcCount_G1_old_generation | JobHistory的Full GC次数 | JobHistory的Full GC次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| js_gcCount_G1_old_generation | JDBCServer的Full GC次数 | JDBCServer的Full GC次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| starrocks_be_async_delta_writer_queue_count | StarRocks BE Async Delta Writer的队列长度 | StarRocks BE Async Delta Writer的队列长度。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_cpu | StarRocks CPU相关监控指标 | StarRocks CPU相关监控指标,从/proc/stat采集。 | ≥ 0 | jiffies | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_cpu_usage | StarRocks CN CPU使用率 | StarRocks CN CPU使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_cpu_usage_allhost | StarRocks CPU使用率 | StarRocks CPU使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,service_name | 5分钟 |
| starrocks_cn_disks_avail_capacity | StarRocks CN指定数据目录所在磁盘的剩余空间 | StarRocks CN 指定数据目录所在磁盘的剩余空间。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_disks_state | StarRocks CN指定数据目录所在磁盘的状态 | StarRocks CN 指定数据目录所在磁盘的状态。1表示正常。0表示异常。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_disks_total_capacity | StarRocks CN指定数据目录所在磁盘的总容量 | StarRocks CN 指定数据目录所在磁盘的总容量。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_engine_requests_failed_total | StarRocks CN 各类型的任务的失败次数的累计值 | StarRocks CN 各类型的任务的失败次数的累计值。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_engine_requests_total | StarRocks CN 各类型的任务的总次数的累计值 | StarRocks CN 各类型的任务的总次数的累计值。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_load_channel_count | StarRocks CN 当前打开的load channel个数 | StarRocks CN 当前打开的load channel个数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_max_mem_relationship_available_mem | StarRocks CN最大内存与机器剩余内存的关系 | StarRocks CN最大内存与机器剩余内存的关系。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_mem | StarRocks CN 内存使用情况 | StarRocks CN 内存使用情况。 | ≥ 0 | KiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_mem_allhost | StarRocks 使用的内存 | StarRocks 使用的内存。 | ≥ 0 | Byte | 1024 | cluster_id,service_name | 5分钟 |
| starrocks_cn_mem_per | StarRocks CN内存使用率 | StarRocks CN内存使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_mem_per_allhost | StarRocks 内存使用率 | StarRocks 内存使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,service_name | 5分钟 |
| starrocks_cn_page_cache_capacity | StarRocks CN Page Cache的容量 | StarRocks CN Page Cache的容量。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_page_cache_hit_count | StarRocks CN Page Cache查询命中次数 | StarRocks CN Page Cache查询命中次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_page_cache_hit_ratio | StarRocks CN Page Cache查询命中率 | StarRocks CN Page Cache查询命中率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_page_cache_lookup_count | StarRocks CN Page Cache查询次数 | StarRocks CN Page Cache查询次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_process_thread_num | StarRocks CN 进程线程数 | StarRocks CN 通过/proc/pid/task采集进程线程数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_query_cache_capacity | StarRocks CN Query Cache的容量 | StarRocks CN Query Cache的容量。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_query_cache_hit_count | StarRocks CN Query Cache查询命中次数 | StarRocks CN Query Cache查询命中次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_query_cache_lookup_count | StarRocks CN Query Cache查询次数 | StarRocks CN Query Cache查询次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_query_cache_usage | StarRocks CN Query Cache内存使用情况 | StarRocks CN Query Cache内存使用情况。 | ≥ 0 | Byte | 1024 | cluster_id,node_id,role_name | 5分钟 |
| starrocks_cn_query_cache_usage_ratio | StarRocks CN Query Cache使用率 | StarRocks CN Query Cache使用率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| nm_availablegb | NodeManager可用的内存量 | NodeManager可用的内存量。 | ≥ 0 | GiB | 1024 | cluster_id,node_id,role_name | 5分钟 |
| nm_containers_failed_rate | NodeManager container运行失败率 | NodeManager上运行container的失败率。 | 0.00-100.00% | % | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| nm_containerscompleted | NodeManager 完成的container数量 | NodeManager上完成的container的数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| nm_containersfailed | NodeManager失败的container数 | NodeManager中失败的container数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| nm_containerskilled | NodeManager被杀死的container数 | NodeManager中被杀死的container数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| nm_containerslaunched | NodeManager已启动的container数 | NodeManager中已启动的container数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| nm_containersrunning | NodeManager正在运行的container数 | NodeManager中正在运行的container数量。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| nm_log_aggregation_tasks_active | NodeManager日志聚合服务中活动的任务数 | NodeManager日志聚合服务中活动的任务数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| nm_log_aggregation_tasks_completed | NodeManager日志聚合服务中已完成的任务数 | NodeManager日志聚合服务中已完成的任务数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| rm_resourcepool_available_memory | Yarn RM可用内存 | Yarn RM可用内存。 | ≥ 0 | MiB | 1024 | cluster_id,service_name,queue_name | 5分钟 |
| rm_resourcepool_available_memory_percent | Yarn RM可用内存占比 | Yarn RM可用内存占比。 | 0.00-100.00% | % | 不涉及 | cluster_id,service_name,queue_name | 5分钟 |
| rm_resourcepool_available_vcore | Yarn RM可用虚拟核 | Yarn RM可用虚拟核。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,service_name,queue_name | 5分钟 |
| rm_resourcepool_available_vcore_percent | Yarn RM可用虚拟核占比 | Yarn RM可用虚拟核占比。 | 0.00-100.00% | % | 不涉及 | cluster_id,service_name,queue_name | 5分钟 |
| rm_rpcprocessingtimeavgtime_default | 主ResourceManager RPC处理平均时间 | 主ResourceManager RPC处理平均时间。 | ≥ 0 | ms | 不涉及 | cluster_id,service_name | 5分钟 |
| 指标ID | 指标名称 | 指标含义 | 取值范围 | 单位 | 进制 | 维度 | 监控周期 |
|---|---|---|---|---|---|---|---|
| zk_avg_latency | ZooKeeper服务处理请求平均延时 | 此指标反映了该ZooKeeper服务处理请求平均延时,如果数值过高表示性能不足。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| zk_fsync_threshold_exceed_count | ZooKeeper fsync门限超限次数 | ZooKeeper fsync门限超限次数。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| zk_max_latency | ZooKeeper服务处理请求最大延时 | 此指标反映了该ZooKeeper服务处理请求最大延时,如果数值过高表示性能不足。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| zk_maxCnxns | ZooKeeper服务最大连接数 | 此指标反映了该ZooKeeper服务的总连接数,可以在ZooKeeper配置界面通过配置项maxCnxns进行配置。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| zk_memory_used_allhost | ZooKeeper总体内存使用大小 | ZooKeeper总体内存使用大小。 | ≥ 0 | MiB | 1024 | cluster_id,service_name | 5分钟 |
| zk_min_latency | ZooKeeper服务处理请求最小延时 | 此指标反映了该ZooKeeper服务处理请求最小延时,如果数值过高表示性能不足。 | ≥ 0 | ms | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| zk_outstanding_requests | ZooKeeper服务待处理请求数 | 此指标反映了该ZooKeeper服务待处理请求数,如果数字过高表示当前负荷较大。 | ≥ 0 | 不涉及 | 不涉及 | cluster_id,node_id,role_name | 5分钟 |
| zk_read_allhost | Zookeeper总体磁盘IO读速率 | ZooKeeper服务磁盘IO速率。 | ≥ 0 | KiB/s | 1024 | cluster_id,service_name | 5分钟 |
对于有多层测量维度的测量对象,使用接口查询监控指标时,需要代入具体指标的维度层级关系。
例如,需要查询MRS集群中HDFS组件的RPC调用总数(nn_rpc_queuetime_numops_default),该指标的维度信息为“cluster_id,service_name”,表示cluster_id为0层,service_name为1层。
- 通过API查询单个监控指标时,维度信息代入样例如下:
dim.0=cluster_id,cfa673a8-28b8-4509-b9f0-132bc5738aa9&dim.1=service_name,HDFS
其中,cfa673a8-28b8-4509-b9f0-132bc5738aa9和HDFS分别为cluster_id和service_name的维度值,具体获取方法请参见“维度”表格中的获取指导。
- 通过API批量查询监控指标时,维度信息代入样例如下:
"dimensions": [ { "name": "cluster_id", "value": "cfa673a8-28b8-4509-b9f0-132bc5738aa9" }, { "name": "service_name", "value": "HDFS" } ]其中,cfa673a8-28b8-4509-b9f0-132bc5738aa9和HDFS分别为cluster_id和service_name的维度值,具体获取方法请参见“维度”表格中的获取指导。
维度
| Key | Value |
|---|---|
| cluster_id | MRS集群ID信息。 该取值可以登录MRS服务管理控制台并进入MRS集群详情页后,查看“概览”页签中的集群ID名称。 |
| node_id | MRS集群内节点ID。 该取值可以登录MRS服务管理控制台并进入MRS集群详情页后,查看“节点管理”页签中的节点名称。 如果节点名称中包含“.”,需替换为“_”,例如界面中获取到的节点名称为“node-master1FwAx.fzr.xxx.com”,则对应的node_id取值为“node-master1FwAx_fzr_xxx_com”。 |
| service_name | MRS集群内组件名称。 该取值可以登录MRS服务管理控制台并进入MRS集群详情页后,查看“组件管理”页签中的组件名称。 |
| role_name | MRS集群内组件的实例名称。 该取值可以登录MRS服务管理控制台并进入MRS集群详情页后,在“组件管理”页签中单击组件名称,进入组件的“实例”页面中查看。 |