文档首页/ 运维管理与迁移服务选型/ 选型指导/ 运维管理服务选型指导
更新时间:2026-07-17 GMT+08:00
分享

运维管理服务选型指导

了解运维管理服务

随着企业IT架构从传统单体架构,向云原生、容器化、分布式微服务架构演进,业务链路层级更深、组件依赖更复杂、资源部署更加分散,系统运行日趋“黑盒化”。传统人工运维与单点监控模式,已难以应对多节点、跨服务、高并发带来的故障排查难、根因定位慢、风险不可预判等痛点。

华为云运维管理领域,面向云上基础设施、容器集群、微服务应用等场景,以全域可观测、数据无孤岛、故障全闭环为核心价值。通过统一整合监控指标(Metrics)、日志(Logs)、调用链(Traces)、系统事件(Events)四大核心运维数据源,实现从底层云资源、中间件、上层应用到前端业务的全栈可视、可查、可分析。依托智能告警、拓扑关联、异常检测、合规审计等能力,推动企业运维模式从被动应急的“救火式运维”,转向主动预防、性能调优、风险前置的现代化智能运维体系,有效缩短故障定位与恢复时长,提升系统稳定性与韧性,最终保障业务持续高可用、安全合规运行,支撑企业数字化业务平稳高效发展。

图1 运维管理服务示意图

在华为云运维管理体系中,可将核心服务划分为可观测性分析类与消息通知类两大类别。

主要实现指标采集、日志管理、链路追踪、全景监控与故障分析,是云上运维的核心数据底座。

  • 云监控服务(Cloud Eye,简称CES):负责底层基础设施的指标与事件的采集与监控。CES是华为云的基础监控底座,主要关注云平台自身资源(IaaS/PaaS,如ECS、RDS、带宽等)的健康状态,提供开箱即用的监控看板和阈值告警能力。华为云各云服务在底层已原生埋点,高频地将CPU利用率、内存、磁盘IO等数值型时序数据写入CES的分布式时序数据库。告警引擎实时拉取数据与用户配置的规则比对,触发状态变更。
  • 云日志服务(Log Tank Service,简称LTS):负责全栈系统与业务日志的汇聚与检索。LTS是一站式的海量日志数据管理平台,支持对主机日志、云服务日志、应用业务日志等进行高效采集、实时搜索、SQL分析、可视化展示及长期低成本存储。通过采集Agent(ICAgent)将日志流式写入缓冲队列(如CCE集群),经过清洗和结构化解析后落盘。基于Elasticsearch搜索引擎支持PB级海量文本日志的秒级检索与统计分析。
  • 应用性能管理(Application Performance Management,简称APM):负责应用全链路调用链追踪与拓扑分析。APM是具备代码级深度诊断能力的应用性能监控与诊断工具,专注于分布式微服务架构下,追踪API接口请求的完整生命周期,帮助开发者解决方法耗时极长、慢SQL卡顿、服务依赖报错等深层次问题。通过字节码注入(如Java Agent)或OpenTelemetry标准探针,自动拦截应用内外部的方法调用,生成TraceID将整个调用链串联。后端计算引擎根据调用流向,实时绘制微服务拓扑图并计算Apdex(应用性能满意度)指标。
  • 应用运维管理(Application Operations Management,简称AOM):作为核心控制台,它将CES的指标、LTS的日志、APM的链路数据进行上下文关联,形成以应用、容器为中心的立体大屏。AOM是云原生时代的统一可观测性门户,它以应用和微服务为中心,将云基础设施、网络、容器编排及应用层的多维运行数据融合,提供一站式的立体监控体验。AOM向下打通CES、LTS、APM的数据底座,向上提供全面兼容Prometheus生态的PromQL查询引擎。它的运行逻辑是通过拓扑树将底层离散的数据串联,实现“指标发现异常 > 拓扑定位节点 > 链路下钻代码 > 日志查看报错”的无缝跳转。同时,AOM具备智能化告警能力,支持告警模板配置、告警抑制与告警消噪,有效减少告警风暴与无效通知,确保运维人员聚焦关键异常,提升告警处置效率。

作为统一告警分发枢纽,承接可观测性分析类服务的异常事件并实现多渠道推送。

消息通知服务(Simple Message Notification,简称SMN):当CES、LTS或AOM触发告警阈值时,将告警事件发送给SMN,由SMN负责把消息定向路由推送到负责人的手机或协作软件中。SMN是高可用、高并发的云端消息分发引擎,它是云上各监控系统与外部人、系统沟通的“路由器”,实现告警事件的可靠触达。逻辑极其清晰:AOM、CES等作为“发布者”将告警发到一个“主题(Topic)”,SMN引擎查找该Topic下的“订阅者”列表,然后并行地将消息转换格式,推送到短信、邮件、企业微信、钉钉或自定义Webhook接口。

明确关键决策维度

在进行可观测性分析类核心服务的选型过程中,需重点权衡以下关键决策维度,以实现合理选型。

明确当前运维工作的核心覆盖层级,判断运维痛点主要集中在基础设施层(如主机、云资源、网络等底层资源)、上层业务应用代码层,还是系统运行流水、操作记录等日志层面,以此匹配对应服务的管理范围。

例如,对于需要监控云服务器CPU、内存等基础状态的场景,选择CES即可;对于需要排查电商大促时微服务接口耗时突增、代码报错的场景,必须引入APM;而如果需要分析海量Nginx访问流水,则选择LTS。

梳理故障排查、性能分析所需的核心数据类型,区分是用于资源趋势监控的数值型指标与事件、用于问题溯源的文本型日志,还是用于分布式应用定位的调用链追踪数据,按需选择对应数据处理能力的服务。

例如,基于数据类型考虑,对于依赖关键词检索报错信息的场景选择LTS;对于依赖全链路拓扑图诊断微服务依赖关系的场景选择APM。

结合企业现有IT技术架构形态进行考量,区分是传统单体化虚拟机架构,还是基于Kubernetes的容器化、云原生分布式架构,适配不同架构下的监控采集、拓扑分析与运维管控需求。

例如,对于部署在传统ECS上的常规业务,CES和LTS的组合通常能满足需求;但对于部署在CCE(云容器引擎)上高度动态的云原生微服务集群,建议选择AOM作为统一门户,因为它能天然解析K8s的Pod/Node拓扑关系,并兼容云原生的Prometheus。

综合评估业务对监控、日志、链路等运维数据的留存时长、归档合规要求,同时结合企业预算管控力度,规划数据存储周期与采集规模,平衡运维效果与成本投入。

例如,对于仅需看近期状态且预算有限的场景,优先采用CES的基础免费额度;对于金融、政务等有合规要求,需要保存系统运行记录半年以上的场景,需规划使用LTS并配置自动转储到OBS对象存储进行低成本冷归档。

选择适合您的服务

表1 可观测性分析类服务

业务场景

数据处理类型

技术架构

成本与规划

核心决策点

选择服务

云平台基础设施与PaaS

(ECS/RDS/带宽等)

数值型指标与事件

传统IT架构

通用云上资源

基础监控完全免费;开箱即用零维护

需要开箱即用的基础资源监控平台,支持CPU、内存等核心指标阈值告警的快速配置,保障底层计算资源的高可用与稳定运行。

云监控服务 CES

业务运行状态与业务报错

(Nginx/业务打印/系统OS)

文本流水数据

适用所有架构

按日志存储量、日志查询与分析、日志处理计费

需要通过关键词快速搜索海量日志报错,或者用SQL分析统计每天的访问量。

云日志服务 LTS

分布式微服务与代码逻辑

(基于Java/Go/Python等开发的应用)

上下文调用链

微服务拓扑

微服务/分布式架构

需注入探针,按探针节点数计费

需要微服务间调用链路拓扑可视化能力,支持基于调用链逐层下钻至代码行级与SQL语句级的性能瓶颈定位,准确定位导致接口响应劣化的根因节点。

应用性能管理 APM

云原生/全栈全局视角

(K8s集群/复杂多层架构)

融合数据

(指标、事件、日志、调用链)

云原生架构

(尤其适用CCE容器)

综合平台性质,支持托管Prometheus

需要统一的可观测性视图,原生支持Kubernetes架构自动识别与资源建模,兼容PromQL高级查询语法,并支持从指标异常点一键下钻至关联日志,实现指标与日志的无缝联动分析。

应用运维管理 AOM

表2 消息通知类服务

业务场景

协作方式

架构解耦

成本

核心决策点

选择服务

告警分发与通信触达

(系统报警到人、外部系统)

跨渠道(短信、邮件、钉钉、企业微信等)

发布/订阅模型,监控引擎无需硬编码联系人

按发送条数、邮件数计费,极低成本

需要一个统一的渠道,把各个监控组件上报的异常,定向分发给值班组的手机,或者推给公司自建的钉钉机器人。

消息通知服务 SMN

快速入门与实践

本章节提供快速入门、最佳实践等参考链接,帮助你深入了解选定的运维管理服务,掌握上手使用方法,快速构建运维能力。

  • 快速入门:监控云容器引擎 CCE的指标

    通过此教程,您将了解如何通过AOM监控云容器引擎(CCE)的CPU使用率指标“aom_container_cpu_usage”,并对指标设置告警阈值条件,当指标数据满足设置的告警阈值条件时产生告警。

  • 快速入门:使用Prometheus监控ECS主机的指标(新版)

    通过此教程,您将了解如何通过AOM监控ECS主机的“node_network_up”指标,并对指标设置告警阈值条件,当指标数据满足设置的告警阈值条件时产生告警。

  • 快速入门:通过Astro大屏应用自定义AOM监控数据大屏

    通过此教程,您将了解如何把AOM中的监控数据呈现在大屏页面,以及如何对页面进行二次开发。

  • AOM全景监控概览

    AOM“全景监控”页面为您提供了资源、应用、日志的全景监控,分别展示了“最新动态”、“告警概况”、“产品使用概况”、“Prometheus 监控”、“应用性能监控”、“Web站点|App 移动端”、“日志监控”、“常用功能”、“常见问题”、“最佳实践”信息卡片。

  • 核心功能:接入AOM

    AOM作为华为云服务可观测性分析统一入口,通过新版接入中心可以快速接入指标、日志和APM调用链。接入完成后,即可方便地在“指标浏览”、“日志管理”、“应用监控”等页面查看相关资源或应用的运行状态、各个指标的使用情况、接入的LTS日志、APM调用链等信息。

  • 最佳实践:将AOM仪表盘图表页面嵌入用户自建系统

    通过此教程,您将了解如何把AOM仪表盘图表页面嵌入到您的自建系统。通过统一身份认证服务IAM的联邦代理机制实现用户自定义身份代理,再将登录链接嵌入至用户自建系统,实现无需在华为云官网登录就可在自建系统界面查看AOM仪表盘图表页面。

  • 快速入门:快速构建主机监控能力

    通过此教程,您将了解如何借助云监控快速构建主机监控能力。通过在华为云公共镜像主机中安装Agent插件,在主机监控以可视化的方式查看其监控数据,以及对重点业务指标进行配置监控告警,及时准确掌握主机资源的云上运行状态。

  • 快速入门:使用自定义看板创建个性化的视图

    通过此教程,您将了解如何通过定制立体化的监控平台。自定义监控看板为您提供自定义查看监控数据的功能,将您关注的核心服务监控指标集中呈现在同一看板里,帮助您实现不同云服务间性能数据对比查看的需求。

  • 最佳实践:告警分级通知配置指导

    通过此教程,您将了解如何通过告警通知策略功能实现告警分级通知,将不同级别的告警通过不同的通知渠道发送给相应的告警接收对象,从而实现通知人员的排班管理。

  • 最佳实践:通过匹配标签的方式灵活配置告警规则

    通过此教程,您将了解如何通过匹配标签来创建资源分组,自动匹配资源,并通过关联资源分组与告警模板的方式自动创建告警规则。若需调整部分资源的阈值,只需修改资源标签即可。

  • 快速入门:使用ICAgent插件采集ECS文本日志到云日志服务

    通过此教程,您将了解如何使用ICAgent插件采集ECS文本日志到云日志服务,帮助您快速上手使用云日志服务。首先需要在采集日志的ECS主机上安装ICAgent插件;然后创建用于存放ECS文本日志的日志组和日志流;其次配置ECS文本日志接入LTS,待日志成功上报到LTS后,即可在LTS控制台查看上报的实时日志。

  • 核心功能:日志接入

    应用程序和服务在运行过程中会产生大量日志数据,包括系统运行状态、错误信息和用户操作记录等。这些数据在系统运维、故障排查和业务分析等关键环节中发挥着重要作用。随着日志数据量的增加和格式的多样化,管理和分析这些数据变得更具挑战性。通过此教程,您将了解日志接入的具体方式、ICAgent插件的相关介绍以及如何进行日志接入配置,帮助您高效地采集日志数据,并将其保存到LTS中。

  • 最佳实践:在LTS页面分析华为云ELB日志

    通过此教程,您将了解ELB日志接入云日志服务后,如何对ELB日志进行日志搜索与分析,帮助您了解日志分析的具体操作步骤。首先对已接入LTS的ELB日志进行日志结构化配置;然后通过SQL语句对日志进行搜索与分析;其次可对日志进行可视化展示与分析。

  • 快速入门:使用增强型Java探针监控应用指标

    通过此教程,您将了解如何使用增强型Java探针监控应用指标,帮助您快速上手使用应用性能管理服务。首先需要接入增强型Java探针;然后在APM界面查看探针接入是否成功。待增强型Java探针接入成功后,即可在APM控制台上查看性能监控指标。

  • 快速入门:接入Web&H5监控前端站点指标

    通过此教程,您将了解如何接入Web&H5前端站点,帮助您快速上手使用APM的前端监控功能。首先需要接入Web&H5前端站点;然后在APM界面查看接入是否成功。待Web&H5接入成功后,即可在APM控制台上查看前端监控指标。

  • 最佳实践:通过调用链的Trace ID精确查询调用链路span信息

    在分布式架构下,微服务之间的调用情况日趋复杂,在外部请求响应变慢、部分请求异常等场景下,想要快速定位哪个环节存在异常,您可以在调用链查询页面,通过Trace ID精确查询调用链详细情况,或结合多种条件筛选查询调用链路。

  • 快速入门:通过SMN发布JSON消息

    通过此教程,您将学会如何在管理控制台创建主题并发布JSON消息。用户可以通过一次消息发布,向不同类型的订阅者发布不同内容的消息。

  • 快速入门:通过SMN发布模板消息

    通过此教程,您将学会如何在管理控制台创建主题并发布模板消息。用户可以通过创建一个消息模板,用模板变量代替变化的内容。在每次发布消息通知时,选择消息模板并设置模板变量便可完成特定的消息通知。

相关文档