# 云架构中心 > 上云后关键问题的设计指导和最佳实践 ## 卓越架构技术框架与实践 - [卓越架构技术框架简介](https://support.huaweicloud.com/usermanual-architecture/architecture_01_0001.md): 卓越架构技术框架(Well-Architected Framework)聚焦客户业务上云后的关键问题的设计指导和最佳实践。以华为公司和业界最佳实践为基础,以韧性、安全性、性能效率、成本优化与卓越运营五个架构关注点为支柱,打造领先的卓越架构技术框架,支撑客户完成云架构设计、云架构治理体系建设、研发生产力提升、现代化应用构建及运营运维体系建设 - [韧性支柱简介](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0001.md): 韧性支柱旨在帮助企业构建具有高可用的应用系统架构,提高工作负载的韧性,使之在面对各种异常场景时仍能提供和维持可接受的服务水平。韧性支柱结合了华为公司韧性设计经验和业界最佳实践,总结并提炼出一系列设计原则与最佳实践,用以帮助企业利用华为云平台基础设施达到高可用、面向各种故障场景进行韧性设计,并具备一定的灾备能力;同时通过规范化变更、部署及应 - [概念表](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0003.md): 业界对韧性没有统一的定义。狭义韧性,指的是自动或快速从故障中恢复运行的能力;而广义韧性,除了从故障中恢复运行的能力外,还包括故障容忍能力。故障容忍(fault tolerance,简称“容错”),是使系统在其某些组件中出现一个或多个故障时能够继续提供服务的能力,从客户的角度来看,该服务仍能完全正常运行,或可能降级运行。而可靠性同样分为狭义 - [什么是应用韧性](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0004.md): 应用韧性是应用系统在运行过程中面对各种异常场景,如基础设施故障(如数据库异常)、外部攻击(如网络DDoS攻击超出预定限额流量)、外部依赖故障(如依赖系统访问超时或不可用)、地域灾难(如大面积停电、洪水)等,仍能提供和维持可接受的服务水平的能力,对系统至关重要。系统韧性设计主要涉及以下两个方面:确保系统具有高可用的架构,如无单点故障各种故障 - [责任共担模式](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0005.md): 云上应用系统的韧性,依赖于云基础设施及应用系统本身的韧性,任何一方故障,都可能会导致云上应用系统故障;因此需要华为云与客户共同承担责任,来保障应用系统的韧性。华为云责任:华为云提供高可用的基础设施,包括运行华为云服务的硬件、软件和机房设施,并确保服务可用性满足SLA服务等级协议。客户责任:客户可以从华为云选择合适的产品并进行可靠性配置以符 - [可用度及SLO](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0007.md): 可用性是衡量可靠性和韧性的综合性指标。可用性目标用于衡量应用系统的运行时间和停机时间,其表现形式为应用系统正常运行的时间占总时间(通常是一个月或一年)的百分比(如99.9%),即:可用度 = 可用时间 / 总时间 * 100%常见的简单表达方式用“9”的数量或“9”的数量加“5”表示,如“三个9”表示“99.9%”,而“三个9一个5”表 - [RTO与RPO](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0008.md): 灾难场景通常采用RTO和RPO目标定义:恢复时间目标RTO:指灾难发生后应用不可用的最长时间。RTO决定了应用容灾整体架构,是采用数据备份,还是冷备、温备、热备。恢复点目标RPO:指灾难发生后应用数据丢失的最大时间。RPO决定了数据备份频率或复制方式,是在线备份还是离线备份,是同步复制还是异步复制。国家标准《信息系统灾难恢复规范》(GB/ - [数据持久度](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0009.md): 数据持久度是指数据不丢失的概率,即存储在预计周期内不出现数据丢失的概率,可以用于度量一个存储系统的可靠性。其只表示数据是否丢失的概率,不体现数据丢失多少;数据持久度的预计周期,一般按一年进行预计。影响存储数据持久度的主要因子有:冗余数、磁盘失效率与数据修复时间。其中每多一个冗余,数据持久度通常可增加2~3个9;云上常用的对象存储,一般采用 - [可用性需求](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0010.md): 根据“常见IT系统SLO示意”中的表格可以得知,不同的IT系统,SLO目标是存在差异的,不是所有的应用系统都需要达到最高可用性要求。当系统可用性目标要求升高时,所需的成本也通常会增加,因此在可用性目标制定时,需要对韧性与成本进行权衡,确定真正的可用性需求。在系统的可用性目标明确后,可参考以下韧性最佳实践来优化系统,使之满足可用性目标要求。 - [设计原则](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0011.md): 由于故障不可避免,如硬件故障、软件错误、网络延迟、突发流量等,因此在设计高可用应用系统时,必须考虑所有的硬件及系统包括的软件都可能会失效,包括IaaS、PaaS、SaaS及应用系统本身。韧性设计的目标不是试图防止这些故障的发生,而是为了在这些故障发生时,能最大程度地减轻故障对系统造成的影响,并持续稳定地运行,建议遵循以下设计原则。单点故障 - [问题和检查项](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0012.md): 企业在进行应用韧性设计的过程中,推荐使用如下问题寻找自身可以改进的点,并参考检查项/最佳实践进行改进,以下所有检查项,也是最佳实践建议,将在下一章节进行详细描述。 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0016.md): 具有高可用的系统必须避免单点故障,以防由于某个节点故障而导致整个系统不可用。本节操作介绍冗余设计方案来消除单点故障,提高可用性。 - [RES01-01 应用组件高可用部署](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0017.md): 应用系统内的所有组件均需要高可用部署,避免单点故障。风险等级高高关键策略应用系统内各组件需要根据其具体能力,采用不同的高可用部署方案:使用原生高可用实例:当云服务既支持单节点资源,又支持主备或集群资源时,应用的关键节点应使用主备或集群资源,如CCE高可用集群、RDS主备实例、DDS集群、DCS主备或集群实例等。对于运行在CCE集群上的工作 - [RES01-02 应用组件多位置部署](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0018.md): 应用组件需要部署在多个数据中心,以避免单个数据中心故障而导致业务中断。风险等级高高关键策略可根据不同需求,将应用的数据和资源部署在多个位置:应用多AZ部署:应用应尽可能部署在多个可用区,避免由于单个可用区故障而导致所有业务中断。应用多Region部署:对于可用性要求高的应用系统,需要考虑多Region部署,避免由于单个Region故障而导 - [RES01-03 云服务器反亲和](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0019.md): 应用内相同业务的ECS需要分散到多台物理服务器,避免运行到同一台物理服务器上,当发生这种情况时,可能会由于一台物理服务器故障而导致业务中断。风险等级高高关键策略针对多个承载相同业务的ECS,需要配置主机组反亲和,从而可以将相同业务的ECS调度到不同物理服务器上,以避免由于单台物理服务器故障而导致所有业务不可用的场景。若ECS通过AS进行弹 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0021.md): 对于应用系统中的重要数据,需要提供备份功能,以便在病毒入侵、人为误删除、软硬件故障等场景,能够快速将数据恢复到备份点。由于容灾通常对数据采用实时复制且没有多备份点,在主数据被误删或误改的情况下,错误数据会同步到备端,从而无法达到数据备份的效果,因此通常不能使用容灾来代替备份。备份恢复时的RPO指标(即数据丢失量),与最近一个备份时间点相关 - [RES02-01 识别和备份应用中所有需要备份的关键数据](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0022.md): 不同数据的重要性不一样,针对应用系统内的所有数据,需要明确其重要性及对应的RPO/RTO指标要求。比如对于重要数据,通常允许数据丢失的时间会比较少,从而需要更频繁的备份;对于一般的数据,允许数据丢失的时间比较长,可以使用较低的备份频率;对于一些不重要的数据,其数据丢失对业务没有影响,则不需要进行备份。风险等级高高关键策略识别应用系统中的所 - [RES02-02 自动数据备份](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0023.md): 对于需要备份的数据,可根据该数据的RPO指标要求,设置定期备份策略进行自动备份。风险等级高高关键策略使用华为云备份服务或第三方备份软件对数据进行备份,并可根据RPO要求设置自动备份频率。CBR云备份服务可对ECS/BMS/EVS/SFS Turbo以及文件目录等进行备份;大多数云服务,如RDS、DDS、DCS等具备原生的创建备份功能;云商 - [RES02-03 定期进行备份数据恢复](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0024.md): 通过定期恢复测试,可以验证备份数据的完整性与恢复处理过程是否可用,且数据丢失时间以及恢复时间符合数据的RPO与RTO指标要求。风险等级高高关键策略定期执行备份数据恢复,以验证备份的完整性。为了避免备份恢复对生产业务造成影响,可以构建一个测试环境,并使用已有的备份数据进行恢复处理。华为云云服务提供了手工恢复功能,用户可定期执行恢复操作,以进 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0026.md): 为了预防单可用区故障,可借助华为云多可用区(Availability Zone,简称AZ)能力,应用可以用较小成本来完成容灾架构部署。应用系统可设计为使用分布在多个可用区中的资源池,并利用云服务实例本身具备或应用自身支持的跨AZ数据复制与切换能力,在多个AZ之间复制数据、负载均衡和跨AZ故障切换,从而使应用系统具备应对可用区故障的能力。 - [RES03-01 集群跨AZ部署](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0027.md): 应用内所有组件均采用跨AZ容灾部署,以避免单AZ故障时业务中断。风险等级高高关键策略云服务实例具备跨AZ高可用实例时,优先使用云服务实例自身的跨AZ高可用实例。云服务实例只支持发放单AZ实例,不支持跨AZ高可用实例时,需要借助其他云服务或应用层实现跨AZ容灾;以ECS为例:对于无状态ECS实例,可利用AS弹性伸缩服务的跨AZ伸缩能力,或E - [RES03-02 跨AZ数据同步](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0028.md): 针对有状态业务,需要进行跨AZ的数据同步,以便在一个AZ故障的情况下,数据不丢失;对于无状态业务不涉及。风险等级高高关键策略当应用组件对应的云服务实例支持跨AZ高可用实例时,可采用云服务实例自身的跨AZ数据同步;如RDS数据库、DCS实例、OBS桶等。当应用组件对应的云服务实例不支持跨AZ高可用实例,但提供了同步服务进行跨AZ数据同步时, - [RES03-03 对接容灾仲裁,支持自动切换](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0029.md): 针对有状态的主备类型业务,在跨AZ部署并支持自动切换时,需要对接容灾仲裁,以避免出现双主或双备,从而在AZ间链路中断的情况下,业务能自动切换到一个AZ提供服务而不受影响;对于集群类业务不涉及。风险等级高高关键策略面向有状态主备类型业务提供容灾仲裁,站点间链路中断不双主,不破坏数据完整性。应用内所有相关组件对接一致性仲裁,在链路中断的情况下 - [RES03-04 支持容灾管理](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0030.md): 提供容灾管理功能,实现容灾状态及RPO监控,及异常场景下的业务切换。风险等级高高关键策略实时监控容灾状态,了解容灾运行状态。支持应用级数据校验,比较AZ间数据同步差异,监控RPO指标。典型确定性故障场景下自动容灾或切换,无需人工接入,业务不受影响,满足RPO/RTO指标。典型亚健康故障场景,支持业务降级或主动切换,业务不持续受损。实时监控 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0032.md): 为了预防区域级灾难发生,或业务跨云容灾需求,需要构建容灾系统提供较为完善的数据保护与灾难恢复能力,以便在站点级灾难发生时,可以保证生产系统的数据尽可能少的丢失,业务系统能在最短时间内由灾备中心接替,恢复业务系统的正常运行,将损失降到最小。对于跨Region容灾场景,应用系统可在多个Region中部署,并将数据从一个Region复制到另一个 - [RES04-01 定义应用系统的容灾目标RPO与RTO](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0033.md): 在进行容灾设计前,需要根据应用系统的重要性,明确其容灾目标,通常以RPO和RTO指标来定义:RPO:允许的数据丢失量,与数据的周期性复制周期或连续性复制延时相关。RTO:允许的业务恢复时长,即业务中断时长,与灾备端业务的部署与切换方式相关。风险等级高高关键策略不同的业务系统重要性不一样,针对应用系统内的各种业务,需要明确其重要性及对应的R - [RES04-02 部署容灾系统以满足容灾目标](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0034.md): 针对不同应用系统的容灾目标,需要综合考虑中断概率、容灾成本等因素,来决定采用什么样的容灾方案来实现这些目标。风险等级高高关键策略面向跨Region/跨云容灾场景,可基于不同的可用性目标要求,采用不用的容灾方案,如远程备份、主备容灾、双活容灾等,其中生产站点根据场景不同可能为其他云或IDC或华为云Region:远程备份:生产站点内的重要数据 - [RES04-03 容灾恢复过程自动化](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0035.md): 由于容灾恢复场景涉及容灾站点的业务恢复、数据库的主备切换、业务到容灾站点的流量切换等,恢复过程比较复杂,因此需要提供容灾管理功能,实现容灾状态及RPO监控,以及灾难场景下的一键式自动切换,减少人工干预。风险等级高高关键策略实时监控容灾状态,了解容灾运行状态。支持应用级数据校验,比较AZ间数据同步差异,监控RPO指标。灾难场景下的一键式自动 - [RES04-04 定期进行容灾演练,以检查恢复能否满足容灾目标](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0036.md): 通过定期的容灾演练,可以验证灾备系统是否可用,且数据丢失时间以及恢复时间符合数据的RPO与RTO指标要求。风险等级高高关键策略每年至少进行一次容灾演练;通过演练可提升操作人员的熟练程度。演练期间需要对恢复过程计时,以确定应用系统的RPO与RTO目标能否满足。演练期间可检查灾难恢复计划执行顺序及恢复时间并进行优化。每年至少进行一次容灾演练; - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0038.md): 应用系统对外或对内通信都依赖于网络,一旦网络异常将会导致业务中断,因此网络架构的高可用及容灾能力至关重要。在进行网络设计时,需要充分考虑应用系统对内和对外的网络连接、IP地址管理和域名解析等。华为云中网络高可用主要涉及三个场景:公有云网络:构建应用系统相关的公网网络连接的高可用,可减少由于网络连接中断而导致的业务中断。混合云网络:对于自建 - [RES05-01 网络连接高可用](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0039.md): 应用系统对外提供服务时,需要确保对外网络连接的高可用,避免单个网络连接中断而导致业务不可用。风险等级高高关键策略网络链路冗余:网络连接需要支持多路径,以实现高可用能力,以避免在一条网络路径中断的情况下,业务能切换到其他路径继续通信。网络链路快速倒换:需要定期检查网络链路的连通性,但检测到失败时需要尽快切换到正常路径。公有云组网场景可通过多 - [RES05-02 避免暴露不必要的网络地址](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0040.md): 网络地址对外暴露时,可能会引入安全风险,需要避免暴露不必要的网络地址。风险等级高高关键策略通常对外网络地址需要尽可能集中管控,避免分散暴露,如使用网络服务ELB弹性负载均衡、公网NAT网关、Web云防火墙等作为公网访问入口。对外的IP地址需要通过安全组、NAT等限制网络端口访问,减少安全风险。通常对外网络地址需要尽可能集中管控,避免分散暴 - [RES05-03 不同流量模型业务的网络共享带宽隔离](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0041.md): 不同流量模型业务共享网络带宽时,可能会导致流量抢占,相互影响,一个业务流量突然可能会导致其他业务不可用。风险等级高高关键策略相同流量模型的业务,可共享网络带宽,带宽需要满足所有共享业务的需求不同流量模型的业务,为了避免相互干扰,建议使用各自独立的共享带宽实例不同特性的业务,建议使用各自独立的域名隔离。相同流量模型的业务,可共享网络带宽,带 - [RES05-04 预留IP资源以便扩展及高可用](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0042.md): 云上网络需要满足可扩展以及高可用需求,以便在云上资源弹性伸缩或业务扩展时,有足够网络资源支撑业务发展。风险等级高高关键策略云上网络规划设计应满足以下原则:针对每个Region,根据业务需要规划不同的VPC,每个VPC使用独立的地址空间;并需要预留IP地址空间用于新建VPC。针对每个VPC中,需要根据业务需要规划子网和IP地址空间;并需要预 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0045.md): 高可用性系统必须具有完善的故障检测能力,以确保能够快速发现那些可能导致故障的事件、显示正在发展的故障、激活的故障,以及潜在的故障的事件。在几乎所有情况下,故障检测能力都是故障恢复的前提。 - [RES06-01 故障模式分析](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0046.md): 故障模式分析是在系统分析和设计过程,通过对各组成单元潜在的各种故障模式及其对产品功能的影响进行分析,并把每一种潜在故障模式按它的严酷度予以分类,找出单点故障和产品的薄弱环节,提出可以采取的预防改进措施,以提高产品可靠性的一种设计方法。当应用系统部署在华为云中时,华为云提供了基础设施的故障管理,应用系统可减少对机房、电力、环境、计算服务器、 - [RES06-02 面向所有故障进行检测](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0047.md): 针对所有故障场景,都需要能自动检测,以便及时发现和恢复故障。风险等级高高关键策略所有故障都必须有检测。支持按不同维度进行故障检测,如Region、AZ、服务、方法、实例或容器ID等,检测维度与故障恢复方式对齐。检测到故障后需及时告警或自动恢复。针对具体故障进行检测时,根据检测的类型通常可以分为资源检测、功能检测和业务检测。资源检测:云环境 - [RES06-03 支持亚健康检测](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0048.md): 系统内组件有可能完全故障,也有可能处于亚健康状态;亚健康是指系统整体业务未超标,但系统中局部实例业务超标。亚健康更多是个相对概念,相对历史表现的统计,或相对系统整体。因此针对亚健康的检测和判断有所不同。当处于亚健康状态时,系统也需要及时进行隔离或恢复处理,避免对业务造成影响。风险等级高高关键策略亚健康检测通常用于根据亚健康症状来预测系统故 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0050.md): 监控是应用运维的基础,确保运维人员通过监控主动发现问题。应用系统需要监控,以便维护人员能快速识别系统运行现状及问题。 - [RES07-01 定义关键指标与阈值并监控](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0051.md): 对资源进行监控时,需要先定义资源的关键指标以及对应的阈值,以便快速有效地发现业务表现和系统状态,以便在异常状态下尽早干预恢复,或定位改进系统缺陷。风险等级中中关键策略关键指标需要与系统内工作负载的关键性能指标相关,并能确定为系统性能下降的早期警告信号,如系统处理的API数量及成功率,相比CPU利用率、内存利用率等基础指标,能更真实的指示系 - [RES07-02 日志统计监控](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0052.md): 应用系统需要收集日志,在必要时对日志进行统计分析,设置告警规则触发告警,统计分析的内容可以是统计一定时间段内某些关键字出现的次数。风险等级中中关键策略日志关键字与出现次数阈值需要合理设置,以免监控信息不正确。日志信息(如关键字或出现频率)发生变化时,需要及时更新告警规则。日志关键字与出现次数阈值需要合理设置,以免监控信息不正确。日志信息( - [RES07-03 监控到异常后发送消息通知](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0053.md): 当对应用系统监控发现应用异常后,需要向相应的人员和系统发送实时通知消息和告警,以便及时处理。风险等级中中关键策略采用实时快捷的消息通知方式,以便相关人员能及时得到消息。消息发送人员需要涵盖运维人员,以便及时恢复。运维人员需要有备份,避免单点风险。SMN消息通知服务可依据用户需求主动推送通知消息,方式可为短信、电子邮件等。CES、AOM、C - [RES07-04 监控数据存储和分析](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0054.md): 监控数据包括统计和日志信息,均需要存储并进行生命周期管理,以满足数据监控的保留要求;并定期对其进行分析,以了解系统运行状态和趋势。风险等级中中关键策略监控数据存储时长需要满足保留要求。监控数据需要定期分析,以便发现或预测系统故障,减少业务中断。监控数据存储时长需要满足保留要求。监控数据需要定期分析,以便发现或预测系统故障,减少业务中断。相 - [RES07-05 端到端跟踪请求消息](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0055.md): 端到端跟踪请求消息的处理流程,便于分析和调试问题,并提高处理性能。风险等级低低关键策略消息跟踪需要包含消息处理流程中所有组件,以便跟踪结果完整,从而进行准确分析和定位。消息跟踪需要包含消息处理流程中所有组件,以便跟踪结果完整,从而进行准确分析和定位。相关云服务和工具应用性能管理 APM:支持调用链追踪,能够针对应用的调用情况,对调用进行全 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0058.md): 对于应用系统,需要识别和管理系统依赖项。应用系统设计人员需要维护对其他系统组件的依赖项的完整列表,包括系统内和系统外的所有依赖。应用系统应尽可能减少关键依赖项,即减少由于该依赖项不可用而导致服务中断的组件。 - [RES08-01 减少强依赖项](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0059.md): 系统内组件之间强依赖时,一个组件故障会对其他组件造成直接影响,影响系统可用性。风险等级中中关键策略可以通过以下技术将强依赖项转换为非强依赖项:提高关键依赖项的冗余级别,降低该关键组件不可用的可能性。与依赖项的通信采用异步消息并支持超时重试,或发布/订阅消息功能将请求与响应分离,以便依赖项从短时故障中恢复。依赖项长时间无法访问时,应用程序应 - [RES08-02 依赖松耦合](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0060.md): 系统内组件之间直接访问时,会产生紧耦合关系一个组件的状态变化会对其他组件产生直接影响,从而会导致所有组件的可用性均下降。而采用松耦合架构时,各个组件之间的依赖关系非常弱,它们可以独立地进行修改和扩展,而不影响其他组件;系统更加灵活,易于维护和升级,并且稳定性和可靠性也更强。风险等级中中关键策略组件之间通过消息队列、消息缓存、负载均衡器等交 - [RES08-03 减少被依赖项故障的影响](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0061.md): 被依赖项自身的可用性需要增强,以减少对依赖它的组件的影响。风险等级中中关键策略对于被依赖项本身,为减少由于服务故障或运行缓慢对依赖它的组件的影响,需要考虑使用以下技术和原则:减少被依赖项本身的外部依赖。优化性能,减少消息响应时延和负载。使用优先队列,优先处理高优先级用户的请求,以便在流量过载时不影响应用系统的核心功能。流量过载时支持功能逐 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0063.md): 当应用系统部署在云中,虽然云具有一定的高可用和故障自动恢复能力,但对外仍会导致短时间的故障,需要应用系统能针对这种短时间故障进行适配处理,主要是采用重试机制。云中故障需要重试的典型场景有:实例主备切换时可能会导致连接中断,如DCS、RDS实例由于某些原因主备切换时,会导致连接中断,需要客户端重试。实例由于故障重启可能会导致通信中断,如EC - [RES09-01 API及命令调用需要设计为可重试](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0064.md): 在进行重试处理时,API及命令调用会重复发送,服务方会多次重复执行,需要保证重复执行多次的结果不变。风险等级高高关键策略应用系统在设计时,应使操作具有幂等性,也就是允许一个操作连续执行两次或多次时,应该与单次调用产生的结果相同,从而保证重试安全;若不支持操作的幂等性,会导致客户端难以重试或重试的处理更复杂。应用系统在设计时,应使操作具有幂 - [RES09-02 客户端需要根据综合评估是否要重试](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0065.md): 当客户端请求超时或收到错误响应时,客户端需要决定是否重试;重试有助于客户端在请求失败时,通过重复消息来获得预期的结果,避免业务失败,但也会消耗更多的服务器时间来获取所需的成功响应。风险等级高高关键策略请求超时,可能是链路闪断或其他临时性故障导致消息丢失,可以进行重试。根据错误响应码进行有针对性的重试;对于临时性故障,如错误码指示为系统繁忙 - [RES09-03 重试需要避免造成流量压力](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0066.md): 对于链路闪断等原因导致的临时性故障,客户端进行一定的重试,可取得较好的效果;对于流量过载等原因导致的故障,重试可能会导致情况进一步恶化,因此需要避免这种影响。风险等级高高关键策略客户端进行重试处理时,建议:增加指数回退和抖动方法,以避免对服务端造成流量压力;采用指数回退重试时,每次重试之间的间隔会逐渐延长,并在两次重试之间引入抖动,以随机 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0068.md): 当系统某个单元发生故障时,如果不采取措施,故障可能会大规模扩散,从而造成整个系统失效。故障隔离技术的核心思想是将一个工作负载内的故障影响限制于有限数量的组件内,降低故障影响范围,防止产生级联故障。通过划分故障隔离域,限制工作负载的影响,可有效进行故障隔离。 - [RES10-01 应用控制平面与数据平面隔离](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0069.md): 通常应用的数据平面处理业务,比较重要,可用性要求比较高,而控制平面不直接处理业务,因此其故障时不应该影响业务系统。风险等级高高关键策略应用控制平面与数据平面隔离,避免控制系统故障影响业务。数据平面所在业务系统的故障恢复可不依赖控制平面,避免由于控制平面故障而导致业务系统无法恢复。应用控制平面与数据平面隔离,避免控制系统故障影响业务。数据平 - [RES10-02 应用系统多位置部署](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0070.md): 通过将应用系统部署在多个位置,可以避免由于一个位置的基础设施故障而导致系统不可用。风险等级高高关键策略将应用系统的数据和资源部署在多个AZ,可避免单个AZ故障影响业务。对于可用性要求较高的应用系统,可部署在多个Region,避免单个Region故障影响业务。当多AZ架构可以满足应用可用性需求时,无需采用多Region部署。将应用系统的数据 - [RES10-03 采用Grid架构](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0071.md): 采用Grid架构,可将应用系统内的工作负载的故障影响限制在有限Grid业务单元中。风险等级高高关键策略应用系统采用多个功能相同的Grid业务单元,每个Grid业务单元具备完整业务功能,处理整个业务负载中的一个子集,不涉及与其他Grid业务单元的交互;在一个Grid业务单元发生故障时,仅影响本Grid业务单元所处理的业务,对其他Grid业务 - [RES10-04 健康检查与自动隔离](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0072.md): 对应用组件进行健康检查,当发现故障后进行主动隔离,避免故障扩散。风险等级高高关键策略对系统内组件需要定期进行健康检查,以判断其状态是否正常。对于异常组件,需要能支持自动隔离,避免对整体业务造成影响。对系统内组件需要定期进行健康检查,以判断其状态是否正常。对于异常组件,需要能支持自动隔离,避免对整体业务造成影响。相关云服务和工具弹性负载均衡 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0074.md): 可靠性测试是为了保证系统在规定的生命周期内,达到预期的可靠性目标;与通常的功能测试不同,可靠性测试需要在业务负荷叠加故障中进行,对测试环境和能力提出了更高要求。可靠性测试和演练通过主动引入故障来充分验证软件质量的脆弱性,从而提前发现系统风险、提升测试质量、完善风险预案、加强监控告警、提升故障应急效率等方面做到故障发生前有效预防,故障发生时 - [RES11-01 混沌测试](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0075.md): 混沌工程(Chaos Engineering)是通过故障注入的方式,触发或模拟实际故障,验证系统的稳定性和容错保护能力。风险等级高高关键策略在真实环境中测试。作为CI/CD管道的一部分例行执行。主动注入故障,以便在问题发生前提前发现并解决问题。以可控方式注入故障,减少对客户的影响。混沌工程度量指标:故障场景的覆盖率:分析故障场景的覆盖率, - [RES11-02 压力负载测试](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0076.md): 通过施加超出系统容量的业务压力,验证云服务的过载保护、业务隔离和优雅降级等能力。为全面验证系统整体的容量规划和业务依赖,云服务应用通常采用全链路压测进行测试。风险等级高高关键策略模拟大量接口消息进行压力测试。模拟各种业务场景进行压力测试。持续自动测试。性能发生偏差时自动告警,以便及时定位和处理。模拟大量接口消息进行压力测试。模拟各种业务场 - [RES11-03 长稳测试](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0077.md): 基于用户使用场景构建业务模型,使用自动化工具构建覆盖系统容量规格70%的业务量,持续7*24小时进行长时间负载测试以评估系统稳定性。风险等级高高关键策略模拟各种业务场景进行测试。持续自动测试。测试结果发生偏差时自动告警,以便及时定位和处理。模拟各种业务场景进行测试。持续自动测试。测试结果发生偏差时自动告警,以便及时定位和处理。 - [RES11-04 灾难演练](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0078.md): 通过容灾演练,可以验证灾备系统是否可用,且数据丢失时间以及恢复时间符合数据的RPO与RTO指标要求。灾难演练着重测试服务跨AZ或跨Region故障转移能力,验证系统的容灾能力以及面对灾难时的应对能力,涉及到多个团队间配合,通常作为专项开展。容灾演练可以帮助企业更好地验证RPO、RTO指标,及时发现和解决相关问题,提高系统的可用性和可靠性。 - [RES11-05 红蓝攻防](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0079.md): 通过红蓝攻防,可以模拟各种复杂的攻击场景,帮助全面评估应用韧性,及时发现并解决潜在风险。风险等级高高关键策略蓝军从第三方角度发掘各类脆弱点,并向业务所依赖的各种软硬件注入故障,不断验证业务系统的可靠性;而红军则需要按照预先定义的故障响应和应急流程进行处置。演练结束后,建议针对故障中的发现、响应、恢复三个阶段的时长和操作内容进行复盘,并梳理 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0081.md): 应用系统无论如何精心设计,仍可能会出现无法恢复的故障,当此类故障发生后,需要进行应急恢复处理。应急恢复处理预先完成设计,并定期演练。 - [RES12-01 组建应急恢复团队](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0082.md): 为了应对紧急故障场景,需要组建应急恢复团队,明确责任人,并进行培训。风险等级高高关键策略组建应急恢复团队:其中包括应急恢复主席及所有组件及关键依赖项的恢复责任人。应急恢复主席:在出现问题后及时组织应急恢复团队进行快速恢复处理。组件或关键依赖项运维责任人:负责问题定位和应急恢复处理。制定应急恢复管理方案:所有应急恢复团队人员都需要进行应急恢 - [RES12-02 制定应急预案](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0083.md): 针对常见问题现象,提供标准化的应急恢复指导,以便在出现问题后,可以有序地完成恢复操作,避免操作失误。风险等级高高关键策略需要覆盖常用典型场景。应急恢复需要有标准的操作流程和动作,确保在事件发生时,相关干系人都能够明确自身职责和所需要采取的措施。每个恢复操作动作必须明确无歧义,可指导操作人员。需要覆盖常用典型场景。应急恢复需要有标准的操作流 - [RES12-03 定期应急恢复演练](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0084.md): 定期测试突发事件应急恢复处理,以便在出现问题后能进行高效的恢复处理。风险等级高高关键策略每年至少进行一次应急恢复演练;通过演练可提升操作人员的熟练程度。演练期间严格按照应急预案进行恢复,以检验应急预案的准确性。演练结束后需要对恢复过程进行回溯,并优化应急预案。每年至少进行一次应急恢复演练;通过演练可提升操作人员的熟练程度。演练期间严格按照 - [RES12-04 出现问题后尽快恢复业务](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0085.md): 应用系统出现故障后,需要能尽快发现,尽快响应。风险等级高高关键策略可以通过以下途径实现故障的快速发现:监控:应用系统需要提供业务监控信息,以便实时了解系统运行状态;维护团队需要有专人观测,并在发现故障发生时,需要及时响应。告警:应用系统在检测到故障后需要及时告警,并能通过短消息、邮件等方式发送给所有相关人员,确保使相关人第一时间得知故障信 - [RES12-05 应急恢复回溯](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0086.md): 在业务进行应急恢复处理后,需要对事件进行回溯并进行优化,以避免故障的再次发生。风险等级高高关键策略对问题进行定位和修复,优化产品能力,减少同类事件的发生。针对应急恢复过程进行总结,优化恢复过程。对问题进行定位和修复,优化产品能力,减少同类事件的发生。针对应急恢复过程进行总结,优化恢复过程。 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0089.md): 当系统流量超过一定阈值后,导致系统处于过载状态时,可能会导致部分请求失败,失败触发业务重试,会进一步增加系统的负荷,形成恶性循环,导致业务成功率远远低于系统的设计容量,甚至整体不可用。因此应用应该设计过载保护机制,使得在过载状态下依然可以保证一定比例设计容量的处理能力。通过过载保护,可以缓解客户流量突增、泛洪攻击或重试风暴所造成的大量容量 - [RES13-01 采用自动弹性扩缩容](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0090.md): 当系统突发流量时,通过自动弹性扩容,可减少业务中断影响。风险等级高高关键策略弹性扩缩容需要通过业务处理逻辑与数据分离、状态外置等技术手段支撑系统处理能力的快速增加或减少。系统扩容和缩容的处理方式有两种,一种是改变单机的处理能力,包括CPU、内存、存储等,称之为纵向伸缩;另一种是单机节点处理能力不变,通过增加节点的数量来改变系统的处理能力, - [RES13-02 应用系统负载均衡,避免流量不均匀](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0091.md): 针对无状态集群业务,通过负载均衡来保证业务均匀分发,可避免部分组件空闲,而部分组件过载而影响业务;同时还可以充分利用系统资源,提高系统性能,改善系统可靠性。风险等级高高关键策略负载均衡分发业务粒度需避免过大,而导致部分组件过载。负载均衡分发时需检查后端节点的负载状态,并根据各节点的负载进行业务分发。在后端节点故障的情况下,需要自动将业务分 - [RES13-03 过载检测与流量控制](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0092.md): 当应用系统发生过载时,可能会导致系统疲于处理请求而无法有效提供服务,因此需要进行过载检测并进行流量控制。风险等级高高关键策略过载控制(也称流控)指系统处于过载时,通过限流、降级、熔断、弹性伸缩等手段,使系统保证部分或者全部额定容量业务成功处理的控制过程;典型过载控制方法定义如下:限流:在系统过载时主动丢弃部分业务请求。降级:在系统过载时提 - [RES13-04 支持主动扩容](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0093.md): 当由于计划性活动而导致资源需求增加时,需要支持主动扩容,避免由于资源不足而导致业务受影响。风险等级高高关键策略当发现应用系统业务需要更多资源时,可主动扩展资源以满足需求,而避免影响可用性。典型场景如产品促销前预测会有突发大流量,则可手工进行扩容处理。华为云服务实例支持主动横向或纵向扩容功能;如对于ECS实例可以通过创建多个ECS实例实现横 - [RES13-05 资源自动扩容考虑了配额限制](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0094.md): 当应用系统在资源不足自动扩容时,需要考虑配额的限制,若配额不足,会导致自动扩容失败。风险等级高高关键策略华为云为防止资源滥用,限定了各服务资源的配额,对用户的资源数量和容量做了限制。如您最多可以创建多少台弹性云服务器、多少块云硬盘。在动态使用云服务资源时,需要了解云服务的限制,避免由于超过云服务配额限制而导致业务故障。当配置自动扩容时,需 - [RES13-06 压力负载测试](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0095.md): 通过压力测试,可衡量系统的弹性扩容能力是否能满足业务要求。风险等级高高关键策略参见“RES11-02 压力负载测试”章节。参见“RES11-02 压力负载测试”章节。 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0098.md): 配置防差错是针对配置过程中因人输入了错误的配置数据导致系统和业务受损或失效场景下,通过产品设计降低或避免配置错误产生的影响。 - [RES14-01 变更防呆检查](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0099.md): 防呆是一种预防矫正的行为约束手段,运用防止错误发生的限制方法,让操作者不需要花费注意力、也不需要经验与专业知识,凭借直觉即可准确无误地完成的操作。风险等级高高关键策略通过以下约束和检查,可减少配置差错:角色约束:通过权限控制设计预防对不同角色的配置范围进行约束,避免越权配置导致错误。查改分离:通过产品界面设计将配置界面分层分级,查看与修改 - [RES14-02 自动化变更](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0100.md): 自动化变更是指自动化提供并管理应用程序的环境(计算、存储、网络、中间件服务等)、安装、配置,实现Infrastructure as a Code;以解决手工部署中易于出错、依赖个人能力,手工配置中变更无法跟踪、难以回滚等难题。风险等级高高关键策略使用配置管理工具进行变更:集中管理配置信息,发现和记录配置变化情况,快速识别变更影响范围。采用 - [RES14-03 变更前数据备份](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0101.md): 通过配置数据事前备份与恢复设计,确保在出现配置错误时能够快速恢复到正确的配置数据状态。风险等级高高关键策略进行全量数据备份,以防变更过程中数据被破坏,影响业务。异常回滚时,可使用备份数据进行恢复。进行全量数据备份,以防变更过程中数据被破坏,影响业务。异常回滚时,可使用备份数据进行恢复。 - [RES14-04 提供runbook进行标准化变更](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0102.md): runbook是指运行手册,是用来实现变更的详细操作过程。变更前需提供标准化runbook用于变更和回退,变更过程中严格按照runbook执行,在变更失败时根据runbook进行回退。风险等级高高关键策略runbook需涵盖变更前检查、变更操作、变更后检查及变更失败回退操作。runbook需涵盖变更前检查、变更操作、变更后检查及变更失败回 - [概](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0104.md): 软件版本在部署或升级过程中,需要尽可能避免业务中断,减少业务影响。建议通过蓝绿部署与滚动升级等最佳实践实现升级不中断业务。 - [RES15-01 自动化部署和升级](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0105.md): 部署和升级过程由代码实现,以固化部件间依赖、安装和配置过程,减少人工错误。风险等级高高关键策略部署和升级过程自动化完成。部署和升级过程自动化完成。 - [RES15-02 自动化检查](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0106.md): 在部署或升级过程中集成基本测试功能,实现自动化检查,无需人工参与。风险等级高高关键策略在部署或升级过程中集成基本测试功能,在部署或升级完成后自动进行检查和测试,以验证新部署的代码功能是否正确。在部署或升级过程中集成故障注入测试功能,在部署或升级完成后自动注入故障进行测试,以验证新部署代码的韧性。在部署或升级过程中集成基本测试功能,在部署或 - [RES15-03 自动化回滚](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0107.md): 在升级或部署过程中出现异常,或检查/测试失败时,支持自动回滚,减少人工干预,避免回滚失败。风险等级高高关键策略检测到异常后,可一键式回滚。回滚过程自动化完成。检测到异常后,可一键式回滚。回滚过程自动化完成。 - [RES15-04 灰度部署和升级](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0108.md): 原地升级和回滚时,升级和回滚过程中业务将会中断,中断时长受限于升级和回滚的时长,对业务影响比较大;而采用灰度部署和升级,可减少升级和回滚过程中的业务中断,提升系统可用性。风险等级高高关键策略通过金丝雀部署、蓝绿部署等方式实现灰度升级或部署,逐步引入新版本部署范围或切换用户流量,配合自动回退以降低部署差错导致业务中断的风险。金丝雀部署(灰度 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0110.md): 本章节以典型Web应用为例,介绍不同可用性目标要求下部署的典型架构示例。针对每种场景,从以下几个维度进行设计,来达成可用性目标。 - [内部工具或公测类应用典型部署架构(99%)](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0111.md): 内部工具类应用通常用于内部操作,且在故障时只会对内部员工造成影响,不可用时只会带来不方便,可以承受长时间的恢复时间和恢复点;公测类应用用于面向客户的实验性的工作负载,在必要时可以隐藏其功能;针对这些应用,其可用性目标通常要求不高,可达到99%,即每年中断时间可以为3.65天。导致业务中断的时间包含故障中断时间及由于升级配置维护等导致的中断 - [内部知识管理类应用典型部署架构(99.9%)](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0112.md): 内部知识管理类应用通常用于内部操作,且在故障时只会对内部员工造成影响,可以承受较长的恢复时间和恢复点,其可用性目标通常要求达到99.9%,即每年中断时间可以为8.76小时。导致业务中断的时间包含故障中断时间及由于升级配置维护等导致的中断时间,假定分别中断时间如下:故障中断:假定每年故障中断4次,每次应急恢复决策时长为30分钟,恢复处理时长 - [信息管理类应用典型部署架构(99.95%)](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0113.md): 信息管理类应用通常用于内部操作,且在故障时只会对内部员工造成影响,可以承受一定的恢复时间和恢复点,其可用性目标通常要求达到99.95%,即每年故障时长可以为4.38小时。假定故障中断与变更中断的时长分别如下:故障中断:假定每年故障中断4次,每次应急恢复决策时长为20分钟,恢复处理时长为10分钟,则每年故障中断时长为120分钟。变更中断:假 - [单Region方案](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0115.md): 采用单Region时,前端以CCE为例,建议方案如下:根据以上方案,典型部署架构如下:该架构的主要特点包括:应用系统采用无状态应用+有状态数据库的分层部署架构。该应用系统在华为云一个Region两个AZ中各部署一套,提供同城容灾能力。接入层(外部GSLB):通过外部GSLB进行域名解析与流量负载均衡,在单个AZ故障时自动将业务流量切换到另 - [双Region方案](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0116.md): 采用双Region时,前端以ECS为例,建议方案如下:根据以上方案,典型部署架构如下:该架构的主要特点包括:应用系统采用无状态应用+有状态数据库/虚拟机的分层部署架构。应用系统在主备Region各部署一套完整系统,主备Region间数据同步;Region内跨AZ高可用部署,提供同城跨数据中心双活能力;Region间数据支持数据异步实时同步 - [金融类核心应用典型部署架构(99.999%)](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0117.md): 金融类核心应用通常比较重要,要求非常短的恢复时间和数据丢失量,其可用性目标通常要求达到99.999%,即每年故障时间可以为5.26分钟。假定故障中断与变更中断的时长分别如下:故障中断:由于要求的故障中断时间很短,要求尽可能自动恢复,没有手动触发的恢复,假定每年故障中断4次,每次自动恢复时长为1分钟,则每年故障中断时长为4分钟。变更中断:假 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0119.md): 电子商务类应用用于外部客户,需要提供较高的可用性,并能承受组件故障,其可用性目标通常要求达到99.99%,即每年故障时间可以为52.56分钟。假定故障中断与变更中断的时长分别如下:故障中断:假定每年故障中断3次,每次应急恢复决策时长为10分钟,恢复处理时长为5分钟,则每年故障中断时长为45分钟。变更中断:假定应用支持金丝雀部署或蓝绿部署, - [跨云容灾方案](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0120.md): 当重要应用系统已经在IDC或其他云上部署,并需要容灾到华为云,以提供高可用的容灾方案。假定应用系统在IDC或其他云上可以达到99.9%的可用性,则在容灾到华为云后,能提供99.99%的可用性。跨云应用典型架构为前端无状态应用层+后端数据库,其中前端无状态应用可采用虚拟机或容器(以容器为例,华为云采用CCE),后端数据库通常要求采用通用My - [跨云双活方案](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0121.md): 当重要应用系统已经在IDC或其他云上部署,并需在华为云上部署一套系统实现双活,以提供高可用的容灾方案。假定应用系统在IDC或其他云上可以达到99.9%的可用性,则在容灾到华为云后,能提供99.99%的可用性。跨云应用典型架构为前端无状态应用层+后端数据库,其中前端无状态应用可采用虚拟机或容器(以容器为例,华为云采用CCE),后端数据库通常 - [概述](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0123.md): 本章节介绍常用云服务的可靠性功能与故障模式,以便应用系统能充分利用云服务提供的可靠性能力,提升应用系统的可靠性,并能针对云服务的常见故障模式,进行故障恢复处理,以便最大限度减少故障,并能从故障中恢复。 - [可靠性功能](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0125.md): 使用CBR云备份服务可对ECS的备份保护服务,支持基于多云硬盘一致性快照技术的备份服务,并支持利用备份数据恢复ECS数据。详见“云备份概述”。当ECS支持自动恢复时,可以开启自动恢复能力,当物理服务器损坏时以冷迁移方式重启ECS实例,使弹性云服务器具备高可靠性和强大的动态迁移能力。当弹性云服务器所在的硬件出现故障时,系统会自动将弹性云服务 - [常见故障模式](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0126.md): 检测:通过CES监控CPU/内存/磁盘容量/磁盘IOPS使用率。恢复:根据业务情况,手工变更规格以扩展资源或增加ECS实例进行负荷分担。对于无状态业务,启动AS弹性伸缩,自动扩展资源。应用层进行过载保护,保障优先业务的运行。根据业务情况,手工变更规格以扩展资源或增加ECS实例进行负荷分担。对于无状态业务,启动AS弹性伸缩,自动扩展资源。应 - [可靠性功能](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0128.md): 使用CBR云备份服务可对BMS的所有云硬盘(系统盘和数据盘)进行备份,支持基于多云硬盘一致性快照技术的备份服务,并支持利用备份数据恢复裸金属服务器数据,最大限度保障用户数据的安全性和正确性,确保业务安全。详见“备份裸金属服务器”。配合共享云硬盘,可以构建AZ内集群或HA关键应用。一块共享云硬盘最多可同时挂载至16台BMS。并需要搭建共享文 - [常见故障模式](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0129.md): 检测:通过CES监控CPU/内存/磁盘容量/磁盘IOPS使用率恢复:根据业务情况,更换规格更高的BMS实例或增加BMS实例进行负荷分担。应用层进行过载保护,保障优先业务的运行。根据业务情况,更换规格更高的BMS实例或增加BMS实例进行负荷分担。应用层进行过载保护,保障优先业务的运行。检测:网络连接失败。恢复:至少部署2个后端BMS。对于无 - [可靠性功能](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0131.md): CCE集群支持3个Master节点高可用部署,确保集群的可靠性。为满足数据持久化的需求,CCE支持将云硬盘(EVS)创建的存储卷挂载到容器的某一路径下;CCE通过云硬盘EVS服务提供针对云硬盘的快照功能,当数据丢失时,可通过快照将数据完整的恢复到快照时间点。详见“快照与备份”。健康检查是指容器运行过程中,根据用户需要,定时检查容器健康状况 - [常见故障模式](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0132.md): 检测:通过AOM监控CCE集群的CPU/内存/磁盘容量使用率。恢复:根据业务情况,手工变更集群规格或扩展资源。根据业务情况,手工变更集群规格或扩展资源。检测:通过AOM监控CCE节点的CPU/内存/磁盘容量/磁盘IOPS/GPU/GPU缓存使用率。恢复:根据业务情况,手工变更节点规格或增加节点数量。根据业务情况,手工变更节点规格或增加节点 - [可靠性功能](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0134.md): ELB采用集群化部署,支持多可用区的同城多活容灾,无缝实时切换。ELB弹性负载均衡支持定期向后端服务器发送请求以测试其运行状态。当判断后端服务器健康检查异常后,就不会将流量分发到异常后端服务器,而是分发到健康检查正常的后端服务器,从而提高了业务的可靠性。当异常的后端服务器恢复正常运行后,负载均衡器会将其自动恢复到负载均衡服务中,承载业务流 - [常见故障模式](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0135.md): 检测:通过CES监控ELB的并发连接数/新建连接数/带宽使用率。恢复:根据业务情况,采用独享型负载均衡器,并手工调整ELB负载均衡器规格。根据业务情况,采用独享型负载均衡器,并手工调整ELB负载均衡器规格。 - [可靠性功能](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0137.md): 配合弹性负载均衡ELB服务,可以对弹性伸缩组创建的弹性云服务器进行负载均衡。健康检查会将异常的实例从伸缩组中移除,伸缩组会重新创建新的实例以维持伸缩组的期望实例数和当前实例数保持一致,伸缩组的健康检查方式主要包括以下两种。云服务器健康检查:是指对云服务器的运行状态进行检查,如关机、删除都是云服务器异常状态。伸缩组的健康检查方式默认是“云服 - [常见故障模式](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0138.md): 检测:查看弹性伸缩组的弹性伸缩活动历史。恢复:根据伸缩活动失败描述信息进行修复。根据伸缩活动失败描述信息进行修复。 - [可靠性功能](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0140.md): DCS服务提供主备、Proxy集群、Cluster集群实例,通过节点冗余方式实现实例容灾,当检测到主节点故障后,快速切换到备节点并自动恢复,在异常检测和恢复期间,可能会影响业务,时间在半分钟内。DCS支持将当前时间点的实例缓存数据备份并存储到OBS中,以便在缓存实例发生异常后能够从备份数据进行恢复。DCS实例支持定时和手动两种备份方式,定 - [常见故障模式](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0141.md): 检测:通过CES监控CPU /内存/带宽/连接数使用率。恢复:根据业务情况,手工变更规格以扩展资源。应用层进行过载保护,保障优先业务的运行,如将部分性能要求不高的业务切回到原始数据源。根据业务情况,手工变更规格以扩展资源。应用层进行过载保护,保障优先业务的运行,如将部分性能要求不高的业务切回到原始数据源。检测:连接失败。恢复:应用层进行重 - [可靠性功能](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0143.md): Kafka实例通过副本冗余方式实现实例容灾,当检测到leader副本故障后,快速完成副本选主,保障Kafka实例持续提供服务。RabbitMQ集群提供镜像队列,通过镜像在其他节点同步数据。单节点宕机时,仍可通过唯一的访问地址对外提供服务。RocketMQ使用一主两备架构,备节点通过数据同步的方式保持数据一致。当节点故障时,通过Raft协议 - [常见故障模式](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0144.md): 检测:通过CES监控CPU /内存/磁盘/带宽使用率。恢复:当CPU/内存使用高时,可根据业务情况,手工修改代理规格或增加代理数量以扩展资源。当磁盘使用率高时,可根据业务情况,修改实例存储空间支持更大存储空间。当带宽使用率高时,可根据业务情况,变更规格以支持更大带宽。应用层进行过载保护,保障优先业务的运行。当CPU/内存使用高时,可根据业 - [可靠性功能](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0146.md): RDS服务支持HA主备高可用架构,故障秒级自动切换。RDS数据持久性高达99.9999999%,保证数据安全可靠,保护业务免受故障影响。RDS支持每天自动备份数据,备份都是以压缩包的形式自动存储在对象存储服务(Object Storage Service,简称OBS)。备份文件保留732天,支持一键式恢复。用户可以设置自动备份的周期,还可 - [常见故障模式](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0147.md): 检测:通过CES监控CPU /内存/磁盘容量/磁盘IOPS/数据库连接数使用率。恢复:根据业务情况,手工变更规格以扩展资源。开启存储空间自动扩容,以便在磁盘容量不足时自动扩容。应用层进行过载保护,保障优先业务的运行。根据业务情况,手工变更规格以扩展资源。开启存储空间自动扩容,以便在磁盘容量不足时自动扩容。应用层进行过载保护,保障优先业务的 - [可靠性功能](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0149.md): 云数据库 TaurusDB服务支持主节点+只读节点的高可用架构,当主节点故障时,系统会自动切换到只读节点,只读节点提升为主节点,原来故障的主节点也会自动恢复为只读节点。云数据库 TaurusDB服务还支持异构容灾实例(MySQL节点),支持在极端场景,如社区未知bug、用户误操作、AZ级故障导致服务无法正常提供服务等场景,可以快速将服务切 - [常见故障模式](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0150.md): 检测:通过CES监控CPU /内存/磁盘容量/磁盘IOPS/数据库连接数使用率。恢复:根据业务情况,手工变更规格以扩展资源。开启自动扩缩容,以便在过载时自动扩容规格和/或只读节点。应用层进行过载保护,保障优先业务的运行。根据业务情况,手工变更规格以扩展资源。开启自动扩缩容,以便在过载时自动扩容规格和/或只读节点。应用层进行过载保护,保障优 - [可靠性功能](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0152.md): OBS通过存储介质的慢盘/坏道检测、AZ内设备和数据冗余、AZ之间数据容灾、跨区域复制等技术方案,提供针对介质、服务器、机柜、数据中心和区域的多级可靠性保障。其数据持久性高达99.9999999999%(12个9),可用性高达99.995%,远高于传统架构。详见“OBS的持久性和可用性如何?”。OBS支持多版本控制,可以在一个桶中保留多个 - [常见故障模式](https://support.huaweicloud.com/usermanual-architecture/architecture_02_0153.md): 检测:通过CES监控请求数、请求成功率、上传/下载带宽等流量指标。恢复:应用层调整批量业务,避免业务高峰期进行备份等业务;应用层进行重试,以应对暂时性故障,如网络拥塞;应用故障重试处理可参考“故障重试”。应用层进行过载保护,保障优先业务的运行。应用层调整批量业务,避免业务高峰期进行备份等业务;应用层进行重试,以应对暂时性故障,如网络拥塞; - [安全性支柱简介](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0078.md): 华为将安全及隐私保护作为公司的最高纲领。安全性支柱旨在确保业务的安全、可信、合规,通过一系列华为云架构的最佳实践保护工作负载免受各种安全威胁,降低安全风险。安全性支柱涉及保护云上系统、资产、数据的机密性、完整性、可用性以及合法、合规使用数据,保护用户隐私的一系列最佳实践。安全性是现代应用程序的重要维度,需要成体系地考虑工作负载的安全。华为 - [责任共担模型](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0002.md): 华为云秉承“将公司对网络和业务安全性保障的责任置于公司的商业利益之上”。针对层出不穷的云安全挑战和无孔不入的云安全威胁与攻击,华为云在遵从法律法规业界标准的基础上,以安全生态圈为护城河,依托华为独有的软硬件优势,构建面向不同区域和行业的完善云服务安全保障体系。与传统的本地数据中心相比,云计算的运营方和使用方分离,提供了更好的灵活性和控制力 - [概念表](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0004.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [概念模型](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0005.md): 华为云的客户在注册账号后,每个账号下可以创建多个IAM用户。对于大型企业的客户,可能会管理多个账号,这些账号可以被统一管理。客户可通过一个企业主账号结合多个企业子账号来统一管理账号。主账号与子账号中都可以再创建更小层级的IAM用户,这些IAM用户分别属于对应的账号,可以帮助账号管理资源。华为云企业中心提供了多个相互独立的华为账号之间形成企 - [设计原则](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0006.md): 国际标准化组织(ISO)对计算机系统安全的定义为:确保信息资产(包括硬件、软件、网络、数据等)受到保护,以确保其机密性、完整性和可用性。计算机系统安全的目标是保护信息系统免受未经授权的访问、使用、披露、破坏、修改、中断或不可用的威胁,同时确保信息系统能够持续地提供服务。系统安全的基本要素包括机密性、完整性、可用性、可审计、不可抵赖性等。其 - [问题和检查项](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0007.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [SEC01-01建立安全管理团队](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0011.md): 指定负责工作负载在云环境的安全性、合规性、隐私保护方面的关键角色,确保从责任主体上保障工作负载的安全性。风险等级高高关键策略明确职责和角色:确定团队成员的职责和角色,包括安全架构设计、安全测试、安全运营等方面的角色。每个角色应清晰定义其职责范围和任务。跨职能团队:组建一个跨职能的安全管理团队,涵盖安全运营、安全架构、安全合规等不同领域的专 - [SEC01-02 建立安全基线](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0012.md): 建立符合合规性要求、行业标准和平台建议的安全基线,安全基线是团队内对安全的底线要求。根据基线定期衡量您的工作负载架构和运行情况,持续保持或改善工作负载的安全状况。风险等级高高关键策略确定合规性要求:了解您的工作负载必须符合的组织、法律和合规性要求。确定合规性要求:了解您的工作负载必须符合的组织、法律和合规性要求。相关云服务和工具华为云合规 - [SEC01-03 梳理资产清单](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0013.md): 梳理工作负载涉及的服务器、IP地址、域名、数据库、证书等全量云资源的资产清单,给资源打上标签,从而在出现安全事件时,能快速定位到有安全风险的资源。风险等级高高关键策略设计态与运行态一致性:对照设计态的架构图、架构文档实施云服务资源。工作负载运行时的架构始终保持与设计态一致。自动化资产盘点:使用安全云服务或工具来自动发现和记录云上资源,包括 - [SEC01-04 分隔工作负载](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0014.md): 分隔工作负载是一种架构上进行分治的思想,通过将整个系统的工作负载分割成更小的部分,每个部分独立运行和管理,从而提高系统的安全性和可维护性。风险等级高高关键策略一个企业特别是大型企业往往有多个不同类型(如生产环境、开发环境、测试环境)或不同组织单元(OU)下的工作负载,多个组织单元之间或多个工作负载之间要进行隔离。分隔工作负载在云环境中是非 - [SEC01-05 实施威胁建模分析](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0015.md): 威胁建模是一种系统性的方法,用于识别和评估可能对系统或组织造成威胁的潜在威胁源、攻击路径和攻击手段。通过识别威胁理解系统的安全风险,发现系统设计中的安全问题,制定消减措施,降低系统风险,提升系统安全性和韧性。风险等级高高关键策略以下是系统运行期间的威胁模型:该模型中涉及的概念如下:威胁主体:有企图的利用脆弱性的实体称为威胁主体;威胁主体可 - [SEC01-06 识别并验证安全措施](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0016.md): 根据团队制定的安全基线以及威胁建模分析的结果,对工作负载中涉及的安全措施进行验证,以确保它们按照预期方式运行并有效地保护系统,从而缓解或消除安全威胁。风险等级高高关键策略依据系统的安全设计文档,通过验证确保安全措施被正确地集成到系统中,并符合最佳实践和标准。尽早检视系统的代码(此过程称为代码白盒安全检视),确保代码符合安全最佳实践,避免在 - [SEC02-01 对账号进行保护](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0019.md): 账号是华为云租户的账号体系中权限最高的用户,拥有对整个云环境的最高权限。一旦账号受到攻击或泄露,可能导致严重的安全问题和数据泄露。因此,身份认证的安全性首先要考虑对此账号进行保护。风险等级高高关键策略强密码:使用强密码来保护账号,包括数字、字母、特殊字符的组合,并确保密码足够长且复杂。多因素认证(MFA):启用多因素认证为保护账号提供了额 - [SEC02-02 安全的登录机制](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0020.md): 将安全的登录机制用于账号、IAM用户以及对接第三方身份提供商。风险等级高高关键策略除了账号,确保IAM管理员(有管理员权限的IAM用户)也开启MFA机制登录,避免登录凭证泄露带来的风险。配置IAM的登录验证策略,如会话超时策略、账号锁定策略、账号停用策略、最近登录提示等。配置IAM的网络访问控制策略。限制用户只能从特定 IP 地址区间、网 - [SEC02-03 安全管理及使用凭证](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0021.md): 在进行身份验证时,首要选择使用临时凭证而非长期或永久性凭证,以减少或消除因凭证意外泄露、共享或被盗而带来的风险。风险等级高高关键策略长期凭证如用户的登录密码、永久AK/SK,短期凭证如临时AK/SK、通过委托获取的权限等。禁止将长期凭证硬编码到代码中,以免泄露。优先使用临时凭证调用华为云的SDK或API。如果某些情况下不能选择临时凭证,才 - [SEC02-04 一体化身份管理](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0022.md): 在公司范围内构建统一的身份管理系统,统一管理私有云和公有云、公有云上多个账号的用户身份。风险等级中中关键策略在公司范围内构建统一身份管理系统,集中存储用户身份信息。统一身份管理系统与私有云、公有云平台的IAM系统进行身份联邦,统一身份管理系统中的用户身份可以同时访问私有云和公有云平台。统一身份管理系统与公司的HR流程结合,当员工入职、调岗 - [SEC03-01 定义权限访问要求](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0024.md): 明确定义哪些人员或机器应当有权访问哪个组件,选择用于进行身份验证和授权的适当身份类型和方法。风险等级高高关键策略使用IAM角色来定义应用程序和组件对资源的访问权限。通过构建最低权限访问模型,确保只授予必要的权限。根据用户的角色和职责分配权限,确保用户只能访问其工作所需的资源。使用IAM角色来定义应用程序和组件对资源的访问权限。通过构建最低 - [SEC03-02 按需分配合适的权限](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0025.md): 权限管理应遵循按需分配、最小授权、职责分离原则。需要根据工作职责限定人员对于关键业务系统的访问权限,以免非必要人员或非授权人员访问到关键系统和敏感数据。如需要临时权限,应仅向用户授予有限的时间段内执行特定任务的权限,并且在任务完成后,应撤销访问权限。风险等级高高关键策略按照IT工作职能划分用户组,将用户加入到与其匹配的用户组中。用户组是I - [SEC03-03 定期审视权限](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0026.md): 定期检视和更新权限,以避免权限蔓延,持续清理无用的权限。风险等级高高关键策略使用IAM用户组控制人员的访问权限,并设置权限的到期时间。如果用户组的职责产生变化,应该及时调整用户组的权限。当账号委托给另一个账号时,设置到期时间。通过IAM用户的“最近一次登录时间”,判断该用户是否为长期未登录的用户,及时管理他们的身份凭证及权限。使用IAM用 - [SEC03-04 安全共享资源](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0027.md): 大企业的不同组织、部门、团队之间需要安全共享资源。风险等级中中关键策略大企业往往涉及多个组织单元、多个账号,需要对多账号之间进行共享资源。安全共享资源需遵循以下实践:使用资源标签。通过标签对资源进行分类和标记,以便于管理和应用策略。仅与可信实体共享资源。通过使用服务控制策略(SCP)限制权限,您可以限制组织内账户的权限,确保资源仅在组织内 - [SEC04-01 对网络划分区域](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0029.md): 网络的分区是将网络划分为多个部分,以隔离不同敏感性要求的网络流量和资源,从而增加网络的安全性。风险等级高高关键策略通过网络分区,可以实现以下目的:隔离敏感数据:将敏感数据和应用程序隔离在独立的网络分区中,以减少未经授权访问的风险。可扩展性:分区和分层可以帮助管理和扩展复杂的网络架构,使其更易于维护和扩展。限制网络流量:控制不同网络分区之间 - [SEC04-02 控制网络流量的访问](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0030.md): 控制网络流量以确保网络分区之间的流量是可预期的、允许的。依据零信任原则,需在网络级别验证所有的流量出入。确保网络设备的业务能力、网络每个部分的带宽满足业务高峰期的需要。风险等级高高关键策略在设计网络拓扑时,仔细检查每个组件的连接要求,例如是否需要互联网可访问性(入站和出站)、连接到VPC的能力、边缘服务和外部数据中心等。除非资源必须接收来 - [SEC02-03 网络访问权限最小化](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0031.md): 确保只有必要的人员或组件可以访问特定的网络资源。风险等级高高关键策略通过配置安全组和网络访问控制列表(ACL),控制进出云资源的网络流量,确保只有授权的流量能够访问特定的服务和端口。根据业务实际情况优化每个网络区域的ACL,并保证访问控制规则数量最小化。避免暴露多余的公网IP,同时不应对外开放或未最小化开放高危端口、远程管理端口。安全组仅 - [SEC05-01 云服务安全配置](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0033.md): 安全配置是一个信息系统的最小安全保障,云服务安全配置是云环境最基本的安全保证,是开展安全防护的基础。正确配置云服务可以帮助防止安全漏洞和数据泄露,提高整体系统安全性。如果云服务没有达到安全配置基线要求,云上业务及资产将面临巨大安全风险。风险等级高高关键策略遵循华为云安全配置基线指南,包括对不同服务的安全配置建议,例如:容器安全,例如容器安 - [SEC05-02 实施漏洞管理](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0034.md): 漏洞管理有助于及时发现并修复系统中存在的安全漏洞,防范潜在的安全威胁和攻击。安全漏洞可能使他人非法获得系统访问特权,应通过可信渠道获取最新的安全情报。风险等级高高关键策略安全漏洞可通过及时安装安全补丁的方式修复漏洞,以防恶意个人或软件非法利用从而破坏业务系统和数据。通过及时了解最新的华为云和业界的安全公告,实施对应消减建议,来保证工作负载 - [SEC05-03 减少资源的攻击面](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0035.md): 通过加固操作系统、减少未使用的组件和外部服务,以及使用工具加强云安全,减少资源的攻击面。风险等级高高关键策略强化操作系统和减少组件:通过减少未使用的组件、库和外部服务,可以缩小系统在意外访问下的危险。这包括操作系统程序包、应用程序以及代码中的外部软件模块。创建安全的虚拟机镜像或者容器镜像。使用第三方工具进行安全性分析:使用第三方静态代码分 - [SEC05-04 密钥安全管理](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0036.md): 密钥的安全管理对于整个工作负载的安全性至关重要。如果使用不恰当的密钥管理方式,强密码算法也无法保证系统的安全。密钥的安全管理包括密钥的生成、传输、使用、存储、更新、备份与恢复、销毁等完整的生命周期流程。风险等级高高关键策略生成密钥:分层管理密钥。最少把密钥分为两层,即:根密钥和工作密钥,根密钥为工作密钥提供加密保护。使用安全的随机数生成器 - [SEC05-05 证书安全管理](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0037.md): 证书的常见用途包括传输数据的加密和系统间的身份认证场景。集中管理每个证书的用途、有效期等信息,并及时对证书替换。风险等级中中关键策略集中管理证书:建立中心化的证书管理系统,用于存储、跟踪和管理所有证书。确保每个证书都有清晰的标识,包括用途、所有者、有效期等信息。有效期管理:定期检视证书的有效期,并确保及时对即将到期的证书进行更新或替换。避 - [SEC05-06 使用托管云服务](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0038.md): 将计算、数据库、存储等资源使用华为云云服务进行托管,避免自行构建增加的开发和运维成本。风险等级低低关键策略实施用于托管资源的服务以便在责任共担模式中减少安全维护任务。例如使用华为云的数据库服务而不是自建关系型数据库的实例。使用Serverless架构的云服务,将计算资源的安全交给华为云处理,减免了用户自行运维服务器带来的工作量和人为错误, - [SEC06-01 安全合规使用开源软件](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0041.md): 开源软件在现代软件开发中的重要性不言而喻。越来越多的企业选择使用开源软件来开发和部署软件应用程序。开源软件的使用必须严格遵守合法合规的底线,包括开源软件的来源、漏洞管理、可追溯、归一化及生命周期管理等方面。风险等级高高关键策略来源可靠。由于开源软件是公开的,因此黑客和攻击者可以更容易地找到其中的漏洞和安全隐患,从而进行攻击和入侵。确保引入 - [SEC06-02 建立安全编码规范](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0042.md): 应用安全涉及需求、设计、实现、部署多个环节,实现的安全是应用安全的重要一环。建立安全编码规范有助于团队编写更安全、更高质量的代码,减少甚至规避由于编码错误引入的安全风险。风险等级高高关键策略发布团队常用编程语言的安全编码规范。通用的安全编码规范应包含程序输入校验、程序输出编码、身份验证、访问控制、安全加解密算法、异常处理、IO操作、文件上 - [SEC06-03 实行代码白盒检视](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0043.md): 代码白盒检视是一种软件质量保证方法,通过检视源代码的内部结构、逻辑和实现细节,以确保代码符合最佳实践、编程规范和安全标准。在代码白盒检视中,团队成员会检查代码的质量、安全性、可读性等方面,以发现潜在的问题和改进空间。风险等级中中关键策略制定检视计划:确定检视的频率和时间安排,以确保代码检视是持续的活动。确定检视范围,例如可以是每次提交、每 - [SEC06-04 应用安全配置](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0044.md): 对应用运行时的各项配置进行加固,以避免因安全配置错误而产生的安全漏洞和风险。风险等级高高关键策略根据安全配置规范,对您工作负载中的应用,如Nginx、Tomcat、Apache、Jetty、JBoss、PHP、Redis等完成安全配置加固和Web攻击防护。系统越权,例如系统是否存在capability提权、suid文件提权、定时任务提权、 - [SEC06-05 执行渗透测试](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0045.md): 渗透测试是一种安全评估方法,模拟攻击者的行为,通过模拟真实的攻击场景来评估系统、应用程序或网络的安全性。渗透测试旨在发现系统中的安全漏洞、弱点和潜在的安全风险,以帮助组织改进其安全措施、加固防御,并保护系统免受真实攻击的威胁。风险等级高高关键策略建议在开发周期的后期执行渗透测试,使系统功能接近预期发布状态,但也要留有足够的时间来解决发现的 - [SEC07-01 识别工作负载内的数据](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0048.md): 通过业务流程、数据流动方向、数据分布、数据的所有者等维度,对照合规要求评估数据的敏感度,对数据分级分类。风险等级高高关键策略遵循以下步骤梳理、识别数据:业务流程分析。了解业务流程,对照业务流程图,明确在各个环节中产生、处理和存储的数据类型和用途。与业务部门、开发团队、运维人员等进行交流,获取关于数据的详细信息。确定数据的分布:需要确定数据 - [SEC07-02 数据保护控制](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0049.md): 针对数据分级分类结果,对每一类数据进行不同级别的数据保护控制,保护数据的机密性和完整性。风险等级高高关键策略实施适当的数据保护措施,如加密和身份验证。管理数据访问权限。了解谁可以访问、修改和删除数据,有助于限制数据访问权限,减少数据泄露风险。验证只有获得授权的用户按照“最小化权限”原则访问数据,确保只有经授权的用户才能执行相关操作。在共享 - [SEC07-03 对数据操作实施监控](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0050.md): 根据数据的分级分类,应对数据的修改、批量操作等行为实施限制措施或建立监控机制。风险等级高高关键策略对数据的修改、批量操作等行为实施限制措施或建立监控机制。使用数据库安全服务DBSS对数据库行为进行审计。数据库安全审计提供旁路模式审计功能,通过实时记录用户访问数据库行为,形成细粒度的审计报告,对风险行为和攻击行为进行实时告警,对数据库的内部 - [SEC07-04 静态数据的加密](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0051.md): 加密可以防止未经授权的人访问和窃取数据。应该默认对敏感的静态数据进行加密,以确保即使数据遭到未经授权访问或意外泄露,也能保持机密性。风险等级高高关键策略启用默认加密。对云硬盘 EVS、关系数据库 RDS、对象存储服务 OBS、弹性文件服务 SFS等云服务配置默认加密,以自动加密存储的数据。启用RDS、DWS等数据库的加密,可降低拖库、数据 - [SEC07-05 传输数据的加密](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0052.md): 对传输中的数据进行加密处理,以确保数据在传输过程中不被未经授权的访问者所窃取、篡改或查看。风险等级高高关键策略使用加密协议:确保在数据传输过程中使用安全的加密协议,以加密数据并保护其在传输过程中不被窃取或篡改。使用最新的TLS版本(如TLS 1.2或更高版本)以确保使用最强的加密标准。安全传输通道:确保数据传输的通道是安全的,避免使用不安 - [SEC08-01 明确隐私保护策略和原则](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0054.md): 明确隐私保护策略和原则是指在处理个人数据时,明确规定和遵守的保护个人隐私数据的总体策略和原则。风险等级高高关键策略明确个人数据的分级及影响。个人数据包括:自然人的email地址、电话号码、生物特征(指纹)、位置数据、IP地址、医疗信息、宗教信仰、社保号、婚姻状态等。个人数据按照影响等级分为高、中、低三种个人数据(分级描述如下表):个人数据 - [SEC08-02 主动通知数据主体](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0055.md): 主动通知数据主体是指数据控制者主动向数据主体(个人)提供信息,告知其数据处理活动的相关信息,例如数据收集的目的、数据处理的方式、数据使用的范围、数据存储的期限等。这种通知通常以隐私政策、用户协议、提示信息等形式呈现。风险等级中中关键策略主动通知数据主体的重要性在于:透明度和可控性:通过主动通知,数据主体可以了解数据处理者如何处理其个人数据 - [SEC08-03 数据主体的选择和同意](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0056.md): 数据主体的选择和同意是指在个人数据被收集、处理或使用之前,数据处理者需要获得数据主体(个人)的明确同意,并且数据主体有权选择是否同意其个人数据被处理的过程。风险等级高高关键策略收集或使用个人数据前,须明确提示用户,并获得用户的同意,并且允许用户随时关闭对个人数据的收集和使用。从数据主体系统中传出包含个人数据的错误报告之前,必须提供机制告知 - [SEC08-04 数据收集合规性](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0057.md): 数据收集合规性是指数据控制者在收集个人数据时需遵守相关的法律法规和隐私保护准则,确保数据收集活动符合法律规定并尊重数据主体的权利。风险等级高高关键策略收集个人数据必须获得数据主体授权。收集敏感个人数据必须获得数据主体明示同意。个人数据收集范围、使用目的、处理方式不得超出隐私声明,且遵循最小化原则。收集到同意之后也需要向数据主体提供撤销或修 - [SEC08-05 数据使用、留存和处置合规性](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0058.md): 数据使用、留存和处置的合规性是指数据处理者在处理个人数据的过程中,包括数据的使用、保留和销毁阶段,需遵守相关的法律法规和隐私保护准则,确保数据处理活动符合法律规定并尊重数据主体的权利。风险等级高高关键策略使用个人数据前必须获取数据主体授权,使用范围及方法不能超出收集目的。系统应将隐私保护的功能默认设置成保护状态。使用个人数据过程中,必须保 - [SEC08-06 向第三方披露个人数据合规性](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0059.md): 在将个人数据分享、转移或提供给第三方时,数据控制者必须遵守相关的法律法规和隐私保护准则,以确保数据转移活动符合法律规定并尊重数据主体的权利。风险等级高高关键策略产品需评估是否存在将个人数据推送给第三方应用。评估是否存在高度敏感的用户数据在未获得用户明示同意便推送。同时应该对齐第三方应用,是否对共享的数据设置了合理的保护机制。用户个人数据转 - [SEC08-07数据主体有权访问其个人隐私数据](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0060.md): 数据主体有权访问其个人隐私数据是指根据相关的隐私保护法律和规定,个人拥有权利要求数据处理者提供关于其个人数据的访问权限。风险等级高高关键策略向用户提供查询、更新个人数据的功能,且必须是实时、无成本,符合主体参与原则。数据主体访问个人数据之前必须有认证机制。记录数据的录入或者更新的时间。建议提供必要的校验措施,比如通过Web页面的输入框录入 - [SEC09-01 实施标准化管理日志](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0063.md): 对身份防线、网络防线、应用防线、主机防线、数据防线和运维防线等日志实施标准化管理,以监测系统和用户活动,实现日志的统一管理,并确保透明可追溯。风险等级高高关键策略跟踪并监测对网络资源和关键数据的所有访问。通过系统的活动记录机制和用户活动跟踪功能可有效降低恶意活动对于数据的威胁程度。常见的安全日志如主机安全日志、操作系统日志、堡垒机日志、I - [SEC09-02 安全事件记录及分析](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0064.md): 在发生安全事件之前,可以考虑构建取证能力来支持安全事件调查工作。记录攻击和异常行为并对其分析:应在关键网络节点处(例如内外网的交界处、ELB流量转发处等)检测、防止或限制网络攻击行为;应采取技术措施对采集的安全日志进行持续监控和分析,实现对网络攻击特别是新型网络攻击行为和异常行为的识别和分析。风险等级高高关键策略在发生安全事件之前,可以考 - [SEC09-03 实施安全审计](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0065.md): 对云服务的关键操作开启安全审计,审计覆盖到每个用户。对审计日志进行保护并定期备份,避免受到未预期的删除、修改或覆盖。风险等级高高关键策略云服务的关键操作包含高危操作(如创建IAM用户、删除IAM用户、重启虚拟机、变更安全配置等)、成本敏感操作(创建、删除高价资源等)、业务敏感操作(网络配置变更等)。启用关键操作通知功能。启用云审计服务CT - [SEC09-04 安全态势感知](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0066.md): 跟踪并监控对网络资源和关键数据的所有访问:通过系统的活动记录机制和用户活动跟踪功能可有效降低恶意活动对于数据的威胁程度。当系统出现错误或安全事件时,通过执行彻底地跟踪、告警和分析,可以较快地确定导致威胁的原因。风险等级中中关键策略采集各类安全服务的告警事件,并进行大数据关联、检索、排序,全面评估安全运营态势。生成定期的安全状态报告,总结安 - [SEC10-01 建立安全响应团队](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0068.md): 建立安全事件响应团队,明确各角色与职责。风险等级高高关键策略安全事件响应团队一般包含如下角色及职责:安全响应专家:主导网络安全事件调查,负责对事件进行定级、通报、攻击溯源以及确定影响范围,制定应急处置措施,推动服务控制风险。攻击溯源专家:根据攻击的IOC信息进行溯源,追溯攻击者信息,攻击范围(无遗漏),攻击溯源图(攻击路径)和攻击溯源报告 - [SEC10-02 制定事件响应计划](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0069.md): 事件响应计划(Incident Response Plan, IRP)是组织安全策略的重要组成部分,它旨在确保在安全事件发生时,能够迅速、有序地采取行动,最大限度地减少损失,并尽快恢复正常运营。风险等级高高关键策略建立事件响应计划,包括定义事件级别、响应流程和恢复策略。对服务可用性有影响或者租户可感知的安全事件划分为5个等级,S1/S2/ - [SEC10-03 自动化响应安全事件](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0070.md): 自动化的响应工作流是安全自动化的核心组成部分,旨在减少安全事件的响应时间,并提高处理效率。风险等级高高关键策略定义响应触发条件:基于威胁情报、异常行为检测和实时监测的结果,确定哪些情况会触发自动化响应。制定响应策略:为每种类型的威胁或事件制定具体的响应动作,例如隔离、修复、通知、调查等。优先级与分级:根据事件的严重性和紧急程度,定义响应的 - [SEC10-04 安全事件演练](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0071.md): 安全事件演练是一种模拟性的活动,旨在让组织成员在一个模拟的安全事件场景下进行实际操作和应对,以测试和提高其应对安全事件的能力。通过安全事件演练,组织可以评估其安全事件响应计划的有效性,发现潜在的问题并进行改进,提高团队的准备性和反应能力。风险等级高高关键策略按照“三化六防”(实战化、体系化、常态化,动态防御、主动防御、纵深防护、精准防护、 - [SEC10-05建立复盘机制](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0072.md): 建立安全事件复盘机制可以帮助团队从过去的安全事件中学习经验教训,并改进未来的安全措施。风险等级中中关键策略确定复盘的目的:在进行复盘之前,明确目的是非常重要的。确定您希望从这次安全事件中学到什么,以及如何改进未来的安全措施。收集事实和数据:收集关于安全事件的所有相关信息和数据,可以用5W2H方法整理该事件,包括事件发生的时间、地点、责任人 - [组织级参考架构](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0074.md): 华为云提供了Landing Zone解决方案帮助企业客户在云上构建架构卓越、安全合规、易扩展的多账号运行环境,首要环节是规划组织和账号架构。按照康威定律,企业在华为云上的组织和账号架构要与企业的组织和业务架构总体保持一致,但也不要完全照搬复制。华为云提供了组织级参考架构,建议按照业务架构、地理架构、IT职能等维度设计组织层级和账号。按照业 - [工作负载级参考架构](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0075.md): 对于一些中小企业,使用华为云单账号即能满足其IT系统管理的诉求。客户会把所有工作负载部署在一个账号内。华为云提供了单账号的工作负载级的安全参考架构。该架构主要的安全设计如下:网络安全防DDoS攻击使用AAD服务Web类攻击采用WAF防护采用SSL证书进行通信加密互联网边界、VPC之间采用云防火墙防DDoS攻击使用AAD服务Web类攻击采用 - [安全性云服务介绍](https://support.huaweicloud.com/usermanual-architecture/architecture_03_0076.md): 安全治理统一身份认证服务 IAM:提供权限管理、访问控制和身份认证的基础服务,安全地控制华为云服务和资源的访问权限。组织 Organizations:为企业用户提供多账号关系的管理能力。用户可以将多个华为云账号整合到创建的组织中,并可以在组织中设置治理策略。应用身份管理服务 OneAccess:为云提供的应用身份管理服务,具备集中式的身份 - [性能效率支柱简介](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0001.md): 如何设计出高性能的架构是一个普遍性的问题。作为基本的质量属性,性能的重要性和性能失败后果的严重性是毋庸置疑的,实际上公司内外都有很多性能失败的例子。本文试图为性能设计、性能优化提供一些技术方法和手段,这些方法手段可以用于系统的软件性能工程建设,也可用于指导性能调整和优化。早期的设计决策会对性能调节能否成功,以及是否有必要进行性能调节产生重 - [基础概念](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0002.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [设计原则](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0003.md): 以下是常用的性能优化指导原则:中心化原则:识别支配性工作量负载功能,并使其处理过程最小化,把注意力集中在对性能影响最大的部分进行提升。本地化原则:选择靠近的活动、功能和结果的资源;避免通过间接的方式去达到目的,导致通信量或者处理量大幅增加,性能大幅下降。共享资源: 采取共享资源的设计,通过协作减少争用延时从而改善整体性能;如多个进程可以从 - [问题和检查项](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0004.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [PERF01-01 全生命周期性能管理](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0008.md): 全生命周期性能管理围绕需求、设计、开发、测试与维护完整的软件生命周期展开,将性能活动内化到生命周期流程中,实现性能工作的常态化。风险等级高高关键策略指定性能目标从性能角度来看,最好为性能场景定义具体的、量化的、可测量的性能目标。若要设置这些目标,需要充分了解业务要求以及预期将提供的服务质量。 需要与业务利益干系人共同实现功能的体验要求,而 - [PERF01-02 应用性能编程规范](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0010.md): 风险等级高高关键策略性能效率是一个系统性的工程,需要综合考虑从架构、设计、编码,到编译、运行的全过程,特别是在编码实现层面,有很多编码技巧,在不影响可读性、可维护性的前提下,提升软件性能。结合编程语言,将高性能编码最佳实践内建的规范中,将会充份发挥性能优势,提升软件的执行效率,最终提升产品的竞争力。高性能编码规范构建策略:JAVA语言:结 - [PERF02-01 定义性能目标](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0013.md): 风险等级中中关键策略建立性能目标是实现工作负载性能效率的重要步骤。性能目标定义了工作负载所需的性能级别,并帮助衡量实现这些目标的有效性。性能目标提供了衡量和比较工作负载效率的基准。此基准可帮助你突出显示改进领域。这些目标还使任务与组织的目标保持一致,并增强业务成果。此外,性能目标还提供资源分配方面的指导,帮助确保工作负载能够适应不同的需求 - [PERF02-02 容量规划](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0014.md): 风险等级中中关键策略容量规划指根据业务需求和系统性能,包括用户数量、并发请求量、响应时间要求等,以此规划和配置系统所需的资源。容量规划对于任何组织来说都非常重要,有效的容量规划可以确保有足够的资源来满足预期的需求,同时避免浪费资源。收集容量数据收集容量数据有助于将业务目标转化为技术要求,并且对于预测容量至关重要。为了满足工作负载需求,收集 - [PERF03-01 选择合适类型的计算云服务](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0017.md): 风险等级中中关键策略根据应用的特征选择合适的计算云服务。选择计算云服务主要考虑以下两个因素:应用本身的部署形态上云时,业务的迁移方式(例如:业务是简单的迁移上云,还是本身要做改造)如果业务本身在IDC部署模式是虚拟机部署,应用系统比较老旧,业务本身也没有改造的计划,建议按照原来IDC的部署模式,采用ECS或者BMS的形式进行应用部署,以满 - [PERF03-02 选择合适规格的虚拟机和容器节点](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0018.md): 风险等级中中关键策略服务器资源就类似一块块资源拼成的木桶,其最多能承载的业务需求取决于哪一块资源最先达到瓶颈。不同应用对资源需求不同,例如:功耗密集型业务(如高性能计算、人工智能、深度学习等场景)主要就是消耗计算维度的容量。内存密集型业务(如大数据处理、图像/视频处理、游戏开发、数据库等场景)主要消耗内存和存储维度的容量。存储密集型业务( - [PERF03-03 使用弹性伸缩](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0019.md): 风险等级中中关键策略如果工作负载能够支持弹性(例如:应用无状态化),请考虑具有自动缩放功能的计算服务,该功能可根据需求自动调整计算容量。自动缩放有助于确保在高峰期拥有足够的资源,并防止在低需求时段过度预配。虚拟机弹性伸缩和容器弹性伸缩都是实现应用自动化扩容和缩容的方式,但虚拟机弹性伸缩需要更多的资源和时间来启动和部署,而容器弹性伸缩可以更 - [PERF03-04 选择合适类型的网络云服务](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0021.md): 风险等级中中关键策略根据网络特征,选择合适类型的网络云服务。场景华为云服务选择策略云上组网(云内、云间)VPC在逻辑隔离的虚拟网络中定义和启动华为资源,方便管理、配置内部网络。ER将VPC和本地网络连接到一个网关中,支持路由学习、动态选路以及链路切换,极大的提升网络地可扩展性及运维效率,从而保证业务的连续性。ESW将VPC和本地网络连接到 - [PERF03-05 选择合适类型的存储云服务](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0023.md): 风险等级中中关键策略在架构设计过程中,根据业务场景、数据特征等因素,选择相应的存储服务。目前可供您选择的有三种数据存储服务,分别是云硬盘、弹性文件服务(Scalable File Service, SFS)以及对象存储服务(Object Storage Service, OBS),这三种数据存储的主要区别如下:对比维度弹性文件服务对象存储 - [PERF03-06 选择合适的消息队列](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0025.md): 风险等级中中关键策略三种不同版分布式消息服务的适用场景如下:Kafka:兼容开源Kafka,适用构建实时数据管道、流式数据处理、第三方解耦、流量削峰去谷等场景,有大规模、高可靠、高并发访问、可扩展且完全托管的特点。RocketMQ:兼容开源RocketMQ,提供顺序、延迟、定时、重投、死信、事务与会话消息等功能,适用电商、金融场景。Rab - [PERF03-07 选择合适的Kafka](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0026.md): 风险等级中中关键策略根据生产流量、消费流量、老化时间、副本数等指标,计算业务所需的规格,选择合适的Kafka规格。规格测算:性能容量维度所需最小节点数 = max((存储带宽需求 / 单节点存储带宽),(网络带宽需求 / 单节点网络基准带宽))磁盘容量维度所需最小节点数 = max(总磁盘容量需求 / 单节点磁盘容量上限)详细规格选择参考 - [PERF03-08 选择合适的RocketMQ](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0027.md): 风险等级中中关键策略RocketMQ服务提供了多个维度定义规格,如资源规格、代理个数、存储容量、单个代理TPS、单个代理Topic数上限、单个代理消费组数上限等,建议根据不同版本涉及的具体规格情况选择合适的RocketMQ服务。详细版本与对应支持规格参数请参考官方文档。RocketMQ服务提供了多个维度定义规格,如资源规格、代理个数、存储 - [PERF03-09 选择合适的RabbitMQ](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0028.md): 风险等级中中关键策略版本选择:RabbitMQ服务版本随时间更迭,选择版本时需注意查看不同版本状态与区分。详情可参考官方公告。规格选择:RabbitMQ服务提供了不同规格实例可供选择,建议按照业务需求对比,选择合适的规格型号。具体实例规格请参考官方文档。版本选择:RabbitMQ服务版本随时间更迭,选择版本时需注意查看不同版本状态与区分。 - [PERF03-10 选择合适的关系型数据库](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0030.md): 风险等级中中关键策略华为云数据库提供了多款关系型数据库服务,包含GaussDB、TaurusDB、RDS(MySQL、PostgreSQL、SQL Server、MariaDB);其中GaussDB、TaurusDB是华为推出的基于openGauss生态和MySQL生态的企业级关系型数据库,性能表现更好;RDS数据库服务可支持四种开源数据 - [PERF03-11 选择合适的非关系型数据库](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0031.md): 风险等级中中关键策略华为云数据库提供了DDS、GeminiDB两种非关系型数据库服务。DDS:文档数据库服务(Document Database Service)完全兼容MongoDB协议,提供安全、高可用、高可靠、弹性伸缩和易用的数据库服务,同时提供一键部署、弹性扩容、容灾、备份、恢复、监控和告警等功能,适用于游戏、物联网业务、互联网应 - [PERF04-01 定义验收标准](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0034.md): 风险等级高高关键策略验收标准是用于评估指定工作负载是否满足性能要求的指标,需要在性能测试前期定义合理的验收标准。查看性能目标性能目标定义了工作负载所需的性能级别。查看为工作负载建立的性能目标。性能目标是可能涉及响应时间、吞吐量、资源利用率或任何其他相关绩效指标的指标。例如响应时间的目标可能低于特定阈值,如小于2秒。定义验收标准将性能目标转 - [PERF04-02 选择合适的测试方式](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0035.md): 风险等级高高关键策略性能测试的常见方式如下,需要注意的是,各种测试方式并不是正交的,而是有耦合关系的:性能验收:性能验收测试的运行环境必须是确定的,验证系统在确定的场景条件下是否达到了其宣称的能力规格。负载测试:是在被测系统上进行负载阶梯加载,直至摸到系统性能极限,一般用来测试系统性能容量或调优。压力测试:是检查系统处于超负载压力下的性能 - [PERF04-03 性能测试步骤](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0036.md): 风险等级高高关键策略1.确定验收性能指标对被测系统从用户角色、开发角色、维护管理员等角色出发分析,结合生产环境系统当前情况,识别并定义业务指标、数据指标、资源指标三种维度指标需要达到的目标基线,指导系统能达到以最小的资源占用管理最大的数据并给用户提供最优的体验目标,输出系统各个场景所要达到的SLA。2.创建测试方案创建测试方案是指设计适合 - [PERF04-04 资源性能数据收集](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0038.md): 风险等级中中关键策略每个华为云提供的云服务都有一组特定于资源功能的指标,用于呈现有关资源的使用情况。通过收集资源性能数据,可以深入了解工作负载的运行状况和行为。指标作用:帮助你了解资源的运行状况和性能,在云监控平台上配置对应的告警策略和配置指标看板。通过跟踪分析网络路径上的流量来优化网络性能。每个华为云提供的云服务都有一组特定于资源功能的 - [PERF04-05 应用性能数据采集](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0039.md): 风险等级中中关键策略应用程序的性能数据(吞吐量、延迟和完成时间),通常需要通过代码采集,例如嵌入代码片段或将工具集成到应用程序代码中。通过应用的性能数据,可以识别性能瓶颈、评估系统行为、识别可用性风险、规划容量等指标。常用应用性能监控策略有:APM 工具:可用使用云上APM 工具或者开源的APM工具和分析性能数据(指标、日志、调研链)使用 - [PERF04-06 建立性能可观测性体系](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0041.md): 风险等级中中关键策略可观测性体系是指在云原生架构中通过使用各种工具和技术来实现对应用程序和基础设施的监控告警、日志、故障排除等功能的一套完整的解决方案。性能可观测体系在此基础上突出了性能指标,通过收集和分析性能数据,可以识别系统瓶颈、优化资源分配等,找到性能优化方向。性能监控对象:服务器、操作系统、数据库、应用程序、网络设备、云服务。常见 - [PERF05-01 设计优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0044.md): 风险等级中中关键策略快速通道模式通过减少支配性工作量负载的处理量,只剩下必要的部分,来改进响应的时间。一个软件可以有多项功能,只有几个是被经常使用的,经常使用的功能构成支配性工作量负载。快速通道模式减少这些功能的处理量,或简化其处理过程。快速通道通过简化执行路径的方式来实现,简化路径即是快速通道。快速通道的前提是识别出支配性工作量,可以根 - [PERF05-02 通用算法优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0046.md): 风险等级中中关键策略算法优化是提高程序性能的关键,可以通过改进算法的设计和实现方式来提高其效率和性能。以下是一些最佳实践:使用正确的数据结构:选择合适的数据结构可以大幅提高算法的效率。例如,使用哈希表可以快速查找元素,使用数组可以快速访问元素。减少内存分配:内存分配是一个耗时的操作。可以通过预先分配内存或者重复使用已分配的内存来减少内存分 - [PERF05-03 WEB场景资源优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0048.md): 风险等级中中关键策略对于已经配置好的资源,可以通过优化来提高性能。例如,优化操作系统的设置、调整网络带宽、优化数据库查询等。云服务资源性能优化步骤包括:识别性能瓶颈: 通过监控和分析云服务资源使用情况,找出性能瓶颈。优化资源配置: 根据性能瓶颈,调整云服务资源的配置,如 CPU 、内存、网络等。使用缓存: 使用缓存技术,如 CDN 、 R - [PERF05-04 大数据场景资源优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0049.md): 风险等级中中关键策略在大数据场景下,可以通过优化资源的使用和分配,提高系统的性能和效率。以下是一些常见的大数据场景资源优化方法:分布式存储:使用分布式存储系统,如Hadoop HDFS、Apache Cassandra等,将数据分散存储在多个节点上,以提高数据的可靠性和可扩展性。数据压缩:对于大量的数据,可以采用压缩算法进行压缩,以减少数 - [PERF06-01 分层看护](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0052.md): 风险等级高高关键策略基于业务的部署架构,一般可以从最底层的硬件基础设施到最上层的应用分成5层资源,云上服务可以只需要关注虚拟网络、实例、应用三层。结合每一层资源的特征指标进行分层建模,分别设置不同梯度的性能看护指标。通常按照指标劣化程度可以设计成一般、紧急、重要三个梯度,对应每个梯度的指标配套对应的处理措施。对于敏感度或业务重要度的应用架 - [PERF06-02 性能劣化自动定界定位](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0053.md): 风险等级中中关键策略通过建立的分层性能模型,判断系统是否会出现性能劣化的情况。当出现劣化事件时,需要通过自动化手段快速定位定界发现根因。可以通过应用模型建设三维的拓扑,把架构-空间-时间数据关联起来。这里面的关键是架构模型的建立及分层指标的聚合可视化能力,需要依赖持续的资源治理和数据治理。根因定位定界通过建立的分层性能模型,判断系统是否会 - [PERF06-03 自动告警](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0054.md): 风险等级中中关键策略通过在云监控平台配置对应的告警策略,可以及时了解资源风险,以便做出对应调整和策略。通过在云监控平台配置对应的告警策略,可以及时了解资源风险,以便做出对应调整和策略。相关云服务和工具:优化顾问 OA云监控服务 CES优化顾问 OA云监控服务 CES - [缓存性能优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0056.md): 以下章节我们结合一些具体建议和案例来说明如何针对缓存的使用进行性能优化。Redis使用规范如下的规范可以帮助我们在系统运行过程中,尽可能减少遇到redis不稳定或异常的概率, 保证系统的长稳运行。业务使用规范数据设计规范命令使用规范 - [Kafka性能优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0058.md): Kafka性能优化优化客户端配置生产者配置建议可参考配置建议。消费者配置建议参数推荐值说明max.poll.records500消费者一次能消费到的最大消息数量,默认为500,如果每条消息处理时间较长,建议调小该值,确保在max.poll.interval.ms时间内能完成这一批消息的处理。max.poll.interval.ms3000 - [RabbitMQ性能优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0059.md): 保持尽可能短的队列长度太多的消息堆积在队列中会造成内存负载过高,为了释放内存,RabbitMQ 会把消息转存到磁盘,转存过程会耗费大量时间,造成消息处理速度下降或直接阻塞生产流程。因此队列中堆积过多的消息容易对 broker 产生负面效应。除此之外,如果节点崩溃后重启,过多的数据会使得重建索引需要消耗大量时间,集群模式下的节点间同步数据也 - [Serverless性能优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0060.md): Serverless函数配置最佳实践运行时语言当选择编译型语言(如Java,C#等),冷启动时延一般由于首次初始化消耗比较大会导致冷启动时延偏高,但是初始化完成后每次执行的时延相较其他解释型语言(NodeJs,Python等)会有一定优势。如果流量不均衡,且对冷启动时延或者最大时延有一定要求的业务使用NodeJs, Python等运行时语 - [数据库性能优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0061.md): 以下章节我们结合一些具体建议和案例来说明如何针对数据库的使用进行性能优化:优化数据库配置实践数据库的配置参数应从具体业务诉求着手,根据实际需要进行设计;华为云在各个数据库云服务中均提供了默认的配置参数,以满足最普遍的业务需要。华为云提供了多款数据库服务,不同服务的优化方式和注意事项均有差异,此方面需求,建议使用华为云提供的专业服务。数据库 - [人工智能性能优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0062.md): 训练优化模型性能提升实践参数调优策略:调整模型flash attention、并行切分策略、micro batch size、重计算策略等参数。尽可能充分利用显存和算力,通过参数调优,初步优化性能。性能拆解参数调优后性能仍然与转商目标有较大的差距,需要考虑进行profiling,采集性能数据后从更底层的算子、通信、调度和内存等维度将性能进 - [HIVE优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0064.md): 概述Hive架构Hive提供了Hadoop的SQL能力,主要参考标准的SQL,Hive进行了部分的修改,形成了自己的特有的SQL语法HQL(Hive SQL),更加适合于Hadoop的分布式体系,该SQL目前是Hadoop体系的事实标准。Hive调优用户输入HQL,Hive将HQL进行词法解析,语法解析,之后生成执行计划,并对执行计划进行 - [Spark性能优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0065.md): 概述Spark是基于内存的分布式计算框架。在迭代计算的场景下,数据处理过程中的数据可以存储在内存中,提供了比MapReduce高10到100倍的计算能力。Spark可以使用HDFS作为底层存储,使用户能够快速地从MapReduce切换到Spark计算平台上去。Spark提供一站式数据分析能力,包括小批量流式处理、离线批处理、SQL查询、数 - [Flink性能优化](https://support.huaweicloud.com/usermanual-architecture/architecture_04_0066.md): 概述Flink是一个批处理和流处理结合的统一计算框架,其核心是一个提供了数据分发以及并行化计算的流数据处理引擎。它的最大亮点是流处理,是业界最顶级的开源流处理引擎。Flink最适合的应用场景是低时延的数据处理(Data Processing)场景:高并发pipeline处理数据,时延毫秒级,且兼具可靠性。集群服务部署架构服务规模与业务容量 - [成本优化支柱简介](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0001.md): 成本优化支柱专注于帮助企业高效地使用云服务来构建工作负载,面向工作负载的整个生命周期不断完善和改进,减少不必要的开支并提升运营效率,让云上应用始终最具成本效益。成本优化实践不意味着只有降本,它是安全合规、韧性等维度的平衡,也是达成业务目标的最优投入。华为公司结合云业务成本运营经验和业界最佳实践总结并提炼出体系化实践与建议,包括:提升成本管 - [基础概念](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0002.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [设计原则](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0003.md): 在成本优化过程中,一个很重要的原则是需要将组织结构,流程和成本管理相匹配。需要建立“责权分明”的体系,否则即使用再好的成本优化工具,也无法将成本优化落到实处。流程上,需要把成本管理作为各个上云流程中必备的一环; 组织上,需要投入适当的时间,资源和人力用于建立云财务管理的能力。 例如,在云账号申请和云资源申请的时候,就需要建立完善的流程,以 - [问题和检查项](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0008.md): 在企业进行成本优化的过程中,推荐使用如下问题寻找自身可以改进的点,并参考检查项/最佳实践进行改进,以下所有的检查项,也是最佳实践建议,将在下一章节进行详细描述。 - [COST01-01 规划企业组织,将组织结构,流程和成本管理相匹配](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0011.md): 风险等级高高关键策略在成本优化过程中,一个很重要的原则是需要将组织结构,流程和成本管理相匹配。需要建立“责权分明”的体系,否则即使用再好的成本优化工具,也无法将成本优化落到实处。一个比较好的实践是在初始的时候,创建一个团队(云业务办公室、云卓越中心或 FinOps 团队),负责在整个组织内建立并维护成本意识。成本优化的负责人可以是了解整个 - [COST01-02 规划IT治理体系,提高管理效率](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0012.md): 风险等级高高关键策略实施与您的组织对应的IT治理结构。这有助于在整个组织内分摊和管理成本。随着经营范围和规模的不断扩张,不断建立子公司、分公司,大部门也逐步拆分成多个小部门,组织结构的层级也就越来越多。企业的IT治理架构也会受到组织结构的影响,需要匹配企业管理模型,帮助企业以多层级组织的方式管理人、财、物,所有资源都可以找到责任团队。企业 - [COST01-03 明确团队责任,建立和维护成本意识文化](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0013.md): 风险等级中中关键策略成本优化的流程中落实成本意识、都需要明确团队责任。一种比较好的实践是使用一组明确定义的 KPI 指标,提供团队级别的报告,实现成本透明度和成本问责制,这些指标可以包含收益/成本比率,单位商品成本,核心资源利用率等等。值得注意的是,成本优化不是一锤子买卖,团队对责任的接受,实施包括指标自身的完善都需要一个过程。 KPI指 - [COST01-04 制定云资源管理策略和相应的权限管理机制](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0014.md): 风险等级高高关键策略由于成本优化是跨组织多个业务部门的事项,而云资源是云上成本的主要开销,故而应该制定策略,确定您的组织应该如何管理资源。如上文所说的,可以使用账号隔离不同组织/部门的资源,甚至于在同一个组织/部门内部,开发,测试,核心业务,非核心业务,也使用不同的账号和环境。然而即使账号/环境是分散的,云资源管理策略和权限管理机制应该是 - [COST02-01 建立云预算与预测流程](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0016.md): 风险等级高高关键策略由于云资源天然的易申请,易缩扩容的特性,使用云可以提高效率、创新速度和灵活性,与此同时,也导致了云成本和使用模式的高度可变,客户应调整现有的组织预算和预测流程,以适应云的变化。客户应密切关注历史消费趋势和不断变化的业务趋势,力求尽可能准确的预算规划。同时结合基于趋势(以历史支出作为输入)的预测和基于业务驱动因素(例如新 - [COST02-02 精细化预算管理和跟踪](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0017.md): 风险等级高高关键策略针对企业不同项目/业务/应用,应该建立预算管理机制,精细化管理每个项目/业务/应用全生命周期的云开销。企业的项目/业务是随时间变化而变化的,一般而言,新兴业务/项目常有更多云资源扩容的需求,而稳定的业务/项目则可以更多考虑单位收益的云成本是否可以持续优化,而处于生命周期末尾的项目/业务则需要考虑逐步释放不再需要的资源。 - [COST03-01 制定成本分摊原则](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0019.md): 风险等级高高关键策略成本分配支撑企业将成本分配到各业务团队中,使得各业务团队的成本清晰可见。这也是上文中明确的团队责任的基础。 根据清晰的成本,业务部门可准确定价,并平衡成本、稳定性和性能,经济高效的提供领先方案。企业管理者基于数据决策各业务的云开支,保障核心业务和战略业务方向的支出,不超支,不浪费。成本分配需匹配业务实质,具体有以下几个 - [COST03-02 可视化成本分摊结果](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0020.md): 风险等级中中关键策略将成本分配到责任团队,使各责任团队及时准确清晰地了解自己业务成本,加强团队成本意识,在构建方案时追求性能、可靠性和成本的平衡。将成本分配到责任团队,使各责任团队及时准确清晰地了解自己业务成本,加强团队成本意识,在构建方案时追求性能、可靠性和成本的平衡。相关服务和工具华为云支持您按照组织规划的方式分配成本。随着云服务的使 - [COST03-03 公共成本分配](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0021.md): 风险等级中中关键策略跨团队共享使用的CDN、直播带宽应按照各业务团队的实际带宽占比,将带宽费用拆分到不同的业务团队。跨团队共享使用的CCE集群服务,应按照各团队分配和使用的CPU/内存等比例,将容器集群成本(包含CCE、ECS、EVS等服务成本)拆分到各个业务团队。以上公共成本,以及其他共享资源&平台服务&服务支持&未及时标记产生的未分配 - [COST04-01 建立规范,持续提升成本分配比例](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0023.md): 风险等级中中关键策略成本是否准确有效的分配,是后续进行成本监控和优化的基础。客户应关注并提升成本分配比例,奠定成本治理的基础。标签作为一种常见的成本分配方式,可以灵活匹配组织内多种分配场景(比如产品、应用、责任人),但在实施标签过程中,企业会发现有各种不利因素导致标签的标记覆盖率下降,例如:实施标签工作量大:云上创建的资源不断增加,资源数 - [COST04-02 主动监控成本](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0024.md): 风险等级中中关键策略不要只在出账后或收到异常通知时再查看成本和用量,应使用工具定期检查成本。定期监控和主动分析成本,有助于您及时识别成本趋势,避免异常发生。不要只在出账后或收到异常通知时再查看成本和用量,应使用工具定期检查成本。定期监控和主动分析成本,有助于您及时识别成本趋势,避免异常发生。相关服务和工具创建预算提醒,将预算设置为提醒阈值 - [COST05-01 分析业务趋势和优化收益](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0026.md): 风险等级高高关键策略云成本是一个综合工程,也是一个定期审核、回顾和执行的流程,除了考虑优化带来的收益以外,还需要考虑相关成本,例如,因为优化带来的人员和时间成本。为了降低整体成本,优化的工作量必须与潜在的节省额成比例。优化可以从应用占成本的比例考虑。 例如,与占总成本 5% 的应用相比,应更经常、更彻底地审核占总成本 50% 的应用。优化 - [COST05-02 建立可以量化的优化目标](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0027.md): 风险等级高高关键策略成本优化是一项投资,而且是一个需要持续进行的流程。为了向公司或者组织的决策者、利益相关方说明投资的价值,就需要对成本优化自身,尤其是其执行的目标进行量化。从而在持续的优化活动中,都可以从决策者或者利益相关者那里得到支持,并获得一个固化的流程框架来衡量成本优化活动的成果。简单的成本优化量化目标/成果就是报告成本节省优化的 - [COST05-03 定期回顾和审核](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0028.md): 风险等级高高关键策略为了让云上应用始终最具成本效益,推荐您定期对其进行回顾和审核,以了解是否有机会实施新的优化措施。回顾和审核可以基于成本分配的原则,在应用级别执行,持续审核组织为每个云上应用付出的总体成本。通过综合考虑云资源成本,研发成本,运营管理成本(如托管服务 vs 非托管云服务)来计算总拥有成本。审核工作量应该体现可能带来的好处( - [COST06-01 了解云上不同计费模式的特点](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0030.md): 风险等级高高关键策略云服务存在按需、包年包月、资源包、竞价实例等多种计费模式,不同的计费模式有着不同的适用场景。企业或者组织需要根据自己的需要,了解不同计费模式的特点,合理选择各种计费模式来适配不同的业务形态和降低费率,实现成本节省。按需计费:适用于临时、突发的业务场景;包年包月:通过预付一定周期的资源使用费用,来获取优惠的计费模式。一般 - [COST06-02 为工作负载选择合适的计费模式](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0031.md): 风险等级中中关键策略分析工作负载的每个组件。确定组件和资源是长时间运行(应享受承诺折扣,包年包月或购买资源包),还是短时间动态运行(采用 Spot 或按需定价)。使用成本管理工具中的建议对工作负载执行分析,并对这些建议应用业务规则以实现高回报。分析工作负载的每个组件。确定组件和资源是长时间运行(应享受承诺折扣,包年包月或购买资源包),还是 - [COST06-03 跟踪并监控权益商品的使用情况](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0032.md): 风险等级低低关键策略客户购买资源包等权益商品时,应定时跟踪资源包的使用情况,若资源包到期或用尽应及时续购,资源包覆盖不足应及时增购,资源包使用过少则应在资源包到期后续购合适大小的资源包,避免浪费。客户购买资源包等权益商品时,应定时跟踪资源包的使用情况,若资源包到期或用尽应及时续购,资源包覆盖不足应及时增购,资源包使用过少则应在资源包到期后 - [COST07-01 持续监控资源利用率指标](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0034.md): 风险等级高高关键策略持续地在组织中定义资源的核心利用率指标(如CPU利用率,内存,CDN服务的流量,数据库的TPS),按(天、周、月)等时间周期发现规律,对低利用率资源的应用/项目进行审查。持续地在组织中定义资源的核心利用率指标(如CPU利用率,内存,CDN服务的流量,数据库的TPS),按(天、周、月)等时间周期发现规律,对低利用率资源的 - [COST07-02 释放闲置资源](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0035.md): 风险等级中中关键策略持续监控资源的闲置情况(如ELB无流量,EVS盘无挂载,EIP没有绑定到虚机),释放资源,或者监控资源使用只是在某个固定的时间(如每天的十二点,每个周末),可以使用自动化的方式定期申请资源,使用后释放持续监控资源的闲置情况(如ELB无流量,EVS盘无挂载,EIP没有绑定到虚机),释放资源,或者监控资源使用只是在某个固定 - [COST07-03 考虑不同的云资源技术选型](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0036.md): 风险等级中中关键策略定期咨询专家或 华为 合作伙伴,以便确定哪些服务和功能的成本更低。查看华为博客和其他信息源。如在非计算密集型场景,使用华为云的云耀系列服务器取代普通ECS服务器定期咨询专家或 华为 合作伙伴,以便确定哪些服务和功能的成本更低。查看华为博客和其他信息源。如在非计算密集型场景,使用华为云的云耀系列服务器取代普通ECS服务器 - [COST07-04 合理降配低负载资源或升配高负载资源](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0037.md): 风险等级中中关键策略根据工作负载和资源特征选择合适的资源大小或类型。您可通过持续监控资源利用率,发现资源的利用率低于/高于阈值,选择降配或者升配资源来优化成本。根据工作负载和资源特征选择合适的资源大小或类型。您可通过持续监控资源利用率,发现资源的利用率低于/高于阈值,选择降配或者升配资源来优化成本。 - [COST08-01 按地域规划应用架构](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0039.md): 风险等级中中关键策略国家已启动“东数西算”工程,将东部发达地区的数据,传输到西部算力资源丰富的地区进行运算、存储。西部数据中心综合成本有明显优势,低PUE低能耗,如贵阳资源价格比广州上海等区域低10%左右。企业可将灾备、离线分析、转码、运维等对网络要求低的系统部署在贵阳、乌兰察布,降低资源成本。可以关注华为云新推出的云区域以及相关的服务, - [COST08-02 云原生架构改造](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0040.md): 风险等级中中关键策略基于云原生架构改造,主要是应用容器化和微服务化的改造,从而发挥云原生的优势,如:自动弹性扩缩容等,容器技术可以提高资源利用率,避免闲置资源,从而降低计算成本,应用微服务化可以降低运维复杂度,从而降低运维成本。广告电商等在线作业服务SLA要求较高,高峰时段明显,使用资源存在潮汐现象;大数据/转码等离线作业容错性高,计算需 - [COST08-03 存算分离](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0041.md): 风险等级中中关键策略传统大数据方案计算和存储融合部署,扩容磁盘时必须扩容计算节点,在实际使用时产生浪费。存算分离是一种数据处理技术,它将数据存储和数据处理(计算)分开,使得存储和计算可以独立地进行优化和扩展,这种技术提高数据处理的效率、降低成本并满足大规模数据存储和分析的需求。如某导购网站日志分析业务,存储经常扩容,计算需求没有明显增长, - [COST08-04 Serverless探索](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0042.md): 风险等级低低关键策略Serverless是下一代云原生范式,无服务计算带来简化的开发运维、更少的资源成本,Serverless架构最大限度计算、存储、网络等资源,提升整体资源利用率、缩短需求发布周期,提高应用的研发效率。用户可以通过云监控服务监控Serverless实例的CPU使用率、内存使用率,当满足一定条件,自动触发Serverles - [成本优化云服务介绍](https://support.huaweicloud.com/usermanual-architecture/architecture_05_0043.md): 成本中心是华为云免费向用户提供的云财务管理服务,可帮助您收集华为云成本和使用量的相关信息、探索和分析华为云成本使用情况、监控和跟踪华为云成本,及时了解云支出的趋势和动因,减少异常支出,持续成本优化。费用中心为您提供财务信息、发票、合同、续费、退订和变更等服务,有助于更好地了解您的消费信息。同时费用中心还提供余额预警、资源包预警等服务,可以 - [卓越运营支柱简介](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0001.md): 在华为公司,卓越运营代表着质量、效率和可持续的卓越客户体验。它帮助改进设计、开发、测试、部署、发布和运维活动,持续实现高质量的交付结果,推动了持续集成和持续交付(CI/CD)落地;同时助力打造确定性运维体系,让研发团队将更多时间用在构建让客户受益的新功能上,减少用于维护和处理突发事件的时间,从而带来运行良好的系统和平衡的工作负载,尤其是卓 - [基础概念](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0002.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [设计原则](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0003.md): 在卓越运营中,团队文化建设至关重要。运营是一门不断改进的艺术。只有不断从已有事故中学习经验,持续学习和改进,才能最终达到卓越运营。故而,团队应该培养持续学习和改进的文化,此外,在事故发生时,应该以对事不对人的态度,思考系统的改进,而不是惩罚或者指责个人。片面指责个人或者直接处罚的做法很容易引起一系列后果,例如后续的运维团队成员由于担心处罚 - [问题和检查项](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0008.md): 在迈向卓越运营的过程中,推荐使用如下问题寻找自身可以改进的点,并参考检查项/最佳实践进行改进,以下所有的检查项,也是最佳实践建议,将在下一章节进行详细描述。 - [OPS01-01 建立持续学习和改进的文化](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0011.md): 风险等级高高关键策略由于系统的独特性和复杂性,没有放之四海皆准的方案,为了达到卓越运营,需要不断改进这些最佳实践,并建立自己的最佳实践。所以,在所有最佳实践的第一条,就是在您的团队中培养持续学习和改进的文化。而持续学习和改进需要鼓励团队沟通和共享,例如,在您公司/组织中总结的最佳实践应该得到广泛地传播,对已有事故的分析,应该得到记录,确保 - [OPS01-02 规划标准化的运维组织](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0012.md): 风险等级高高关键策略承载卓越运营,应该建立适应您实际的运维组织。运维组织的团队之间具有明确的流程,规定了团队之间的协作方式,例如规定不同团队的响应时间、服务级别目标(SLO) 或服务等级协议(SLA),同时应该记录团队间沟通信息,确保有足够的数据用于后续的改进。例如一种运维组织设计是:将运维组织分为一线、二线和三线阶梯型运维支持团队,一线 - [OPS01-03 规划标准化的运维流程和运维工具](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0013.md): 风险等级高高关键策略流程和工具是经验的承载,通过标准化的流程,可以大幅降低在运维过程中因为个人的因素受到的影响和无序化。 通过标准化的、统一的运维工具,向运维人员提供集中、统一维护界面及清晰易上手的操作手册,方便运维人员的集中维护,提高运维效率。常见的运维流程有:变更管理流程:适用于生产环境软、硬件的变更活动管理,减少变更导致服务意外中断 - [OPS02-01 进行需求管理和迭代开发](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0015.md): 风险等级高高关键策略您的云上应用要达到卓越运营,从设计和开发阶段就需要保证可用性,可恢复性,同时也需要保证代码的质量。您需要评估和了解软件DFX相关要求,包括可靠性、性能、可服务性、可运维性、可交付性等要求 将监管、行业和内部合规性要求纳入需求范围中,同时在需求排序的时候,给予这些需求足够的时间和重视。同时从可维护性来看,较之于一次性颠覆 - [OPS02-02 关联源代码版本和部署的应用版本,使用代码质量最佳实践](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0016.md): 风险等级高高关键策略在代码开发阶段,需要开展代码协作设计和管理。使用现代化的代码仓管理代码,确保代码合并后,代码将保持一致,并且不会丢失任何更改。通过正确的版本控制,同时,现代化的代码仓可以方便设置代码版本,关联源代码版本和部署的应用版本,在运维阶段,一旦部署在云上的应用发生任何问题,可以方便回溯到源代码,而且方便使用上一版本的源代码回滚 - [OPS03-01 推行开发者测试](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0018.md): 风险等级高高关键策略开发者测试是现代软件工程中非常重要的一环,一般而言,开发者的测试代码可以在本地,或者构建阶段反复多次执行,依赖低,也是在软件系统运维之前成本最低的发现软件问题的方式,尤其是各种异常场景或者用户输入,开发者测试的过程实际上“强制”了开发者去思考线上业务可能出现的场景,从而有利于减轻后续运维阶段系统的负担。此外,云上的软件 - [OPS03-02 使用多个环境进行集成测试,构建和生产环境相同的预生产环境](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0019.md): 风险等级高高关键策略开发者测试虽然成本低,但是缺乏对生产环境配置以及不同服务和应用之间实际交互的验证。为此,您的组织可以在云上提供多个环境,典型的环境包含测试环境,预生产环境和生产环境。在生产环境部署之前,可以通过测试环境进行联调测试,验证不同团队代码之间的业务交互流程是否正确。但是测试环境和生产环境的配置不尽相同。 而预生产环境使用与生 - [OPS03-03 进行性能压测](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0020.md): 风险等级高高关键策略性能压测主要通过自动化的测试工具模拟多种正常、峰值以及异常负载条件来对系统的各项性能指标进行测试。通常把性能测试、负载测试、压力测试等统称为性能压测。广义而言,是为保证系统运行后的性能可以满足用户需求,而开展的一系列测试组织工作。在应用系统上线发布之前,通过性能压测,测试应用系统能承受的最大并发、响应速度、以及稳定性是 - [OPS03-04 对生产环境进行拨测](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0021.md): 风险等级高高关键策略拨测是利用软件系统以外,甚至现有账号或云Region外的系统,以系统用户使用场景为视角,模拟用户使用场景的测试。和普通的云拔测可实现对网络质量、页面性能、端口性能、文件传输、音视频体验等场景进行周期性监控,支持多维度分析性能指标。利用可视化性能数据及时对业务质量做出反应,保证业务稳定正常运行。拨测是利用软件系统以外,甚 - [OPS03-05 进行混沌测试和演练](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0022.md): 混沌工程(Chaos Engineering)是通过故障注入,验证故障快速恢复能力及系统可靠性的实践活动。风险等级高高关键策略通过混沌工程的方法模拟可能出现的故障,进而综合验证系统在不同故障场景下的容错能力、监控能力、应急响应能力、定界定位、快速恢复等确定性恢复能力。验证高可用设计:业务系统在规划设计阶段进行架构高可用设计、监控设计,在上 - [OPS04-01 有效落地持续集成](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0024.md): 风险等级高高关键策略持续集成是一种软件开发实践,开发人员使用它定期将软件更新集成到源代码控制系统中。当工程师向代码仓提交代码时,持续集成过程就开始了。理想情况下,集成过程会根据多个基线和测试来验证代码。然后,它向提交者提供有关这些测试状态的反馈。如果基线检查和测试进展顺利,集成过程将生成并暂存部署更新软件的资产。这些资产包括编译的代码和容 - [OPS04-02 采用持续部署模型](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0025.md): 当部署出问题时,通过使用持续部署模型来实现尽早发现问题,减少对最终用户的影响。金丝雀部署是持续部署的常见模型,通过一小群内部或外部用户首先部署新功能,当新版本没有问题后,陆续部署到更大的组,直到所有用户群体都运行新版本。另一种常见的部署模型是蓝绿部署,通过部署了两组相同的工作负载实例,分别处理完整的生产负载。第一个(蓝色)实例处理所有工作 - [OPS04-03 基础设施即代码](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0026.md): 基础设施即代码(IaC)是指使用代码而不是手动流程来管控基础设施的能力。 应用程序环境都需要许多基础设施组件,例如操作系统、数据库连接和存储。 开发人员必须定期设置、更新和维护基础设施,以开发、测试和部署应用程序。 手动管理基础设施既耗时又容易出错,尤其是在大规模管理应用程序时。风险等级高高关键策略使用声明式工具:与命令式工具相比,声明式 - [OPS04-04 自动化工程运维任务](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0027.md): 在日常开发工作中,尽可能自动化一切,以减轻管理负担并最大限度地减少人为错误。为了最大限度地提高自动化投资的价值,优先考虑简单、程序化且长期的任务。应用自动化并不是一种全有或全无的策略。即使需要人工干预的工作流(例: 决策点),也可以从自动化中受益。风险等级高高关键策略优先考虑从自动化中受益最多的任务:专注于高度程序化且容易出现人为错误的任 - [OPS05-01 进行生产准备度评审(Product Readiness Review)](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0029.md): 风险等级高高关键策略Production Readiness Review 生产准备度评估基线:从SLI/SLO、可冗余、可容灾、可过载控制、可故障管理、可变更能力、可运维、安全生产等维度,对服务可用性及运维能力提出基线要求。在服务产品开发前端构筑能力,进行相关需求规划、设计和开发工作,并在服务上线前进行生产准入审视。具备以下核心价值:1 - [OPS05-02 进行变更风控](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0030.md): 风险等级高高关键策略根据不同变更场景构建风险控制能力,通过风险数字化度量分析和评估风险影响程度,并采取风险控制措施削减或规避风险,保障变更成功。变更风险指现网各要素增、删、改及状态改变(如版本迭代、配置改变、节点扩缩容等)时引发的业务中断风险及变更失败可能导致的业务受损风险。设计建议变更风控衡量指标:变更风控衡量指标为变更导致事件密度和变 - [OPS05-03 定义变更流程](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0031.md): 风险等级高高关键策略在建立标准的变更管理流程前,清晰明白变更各个流程的定义:变更发起:在变更发起前,需明确变更内容与变更原因等信息。信息的明确可减轻变更评估人的工作量,同时明确变更的意义。变更信息包括:基本信息:标题、时间、变更人、原因等。变更信息:变更系统、变更场景、变更类型等。变更方案:变更实施方案、回滚方案、验证方案等。变更审批:由 - [OPS06-01 建立可观测性体系](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0033.md): 可观测性(observability)最初是系统理论中的一个概念,指系统的状态能否被外部观察到和重现。随着云原生、微服务架构的发展,IT系统对可观测性的需求日益增强。业界对可观测性的定义:通常是指基于对复杂系统外部输出的了解,能够了解其内部状态或状况的程度。系统越可观测,定位问题根本原因的过程就越快速越准确,而无需进行额外的测试或编码。风 - [OPS06-02 定义可观测对象](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0034.md): 风险等级高高关键策略客户可感知的观测对象分类如下:可观测分层功能 / 主要指标IT 资源监控IT 资源监控对 IT 资源的性能和容量进行监视和报告,确保您的业务稳定可靠运行应用监控应用监控基于应用资源管理对资源实行从应用、业务组件、到环境的分层监控,每一层对应的观测指标均不同。在应用层,主要监控业务层、应用层、中间件层以及基础设施层告警信 - [OPS06-03 制定和实施可观测性指标](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0035.md): 风险等级高高关键策略指标是对时间周期内的测量数据的数值表示。可观测性指标是围绕发现率、定级准确率、定界时长、覆盖率、有效率、 一致率打造可观测能力,将可观测设计规范统一发布,统一设计要求与运维管理要求。指标是对时间周期内的测量数据的数值表示。可观测性指标是围绕发现率、定级准确率、定界时长、覆盖率、有效率、 一致率打造可观测能力,将可观测设 - [OPS06-04 规范化应用日志](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0036.md): 日志是随时间推移发生的不可变、记录时间戳的离散事件。系统需要记录关键事件和故障,以帮助诊断问题和解决故障。风险等级高高关键策略对于一个系统来说,日志是非常重要的。它可以记录在系统中发生的一切,包括成功的操作、错误的操作、警告信息等等。因此,日志记录是可观测性设计中最基本的需求之一。通过将事件和错误信息记录到日志文件或数据库中,可以方便地进 - [OPS06-05 实施依赖项遥测](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0037.md): 风险等级高高关键策略依赖项遥测可以监控工作负载所依赖的外部服务和组件的运行状况及性能。提供有关与 DNS、数据库或第三方 API 等依赖项相关的可访问性、超时及其他关键事件的高价值指标采集。当对应用程序进行检测,以发布有关这些依赖项的指标、日志和跟踪时,就能更清楚地了解可能影响工作负载的潜在瓶颈、性能问题或故障。依赖项遥测可以监控工作负载 - [OPS06-06 实施分布式跟踪](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0038.md): Trace是一系列因果相关的分布式事件的表示,这些事件编码了流经分布式系统的端到端请求流。风险等级高高关键策略当系统出现问题时,需要能够追踪系统中每个组件的行为和交互情况。通过在系统中实现分布式跟踪,可以快速定位问题并进行有效的故障排除。当系统出现问题时,需要能够追踪系统中每个组件的行为和交互情况。通过在系统中实现分布式跟踪,可以快速定位 - [OPS06-07 通过可观测性指标引入自动化措施](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0039.md): 风险等级高高关键策略可观测与自动化运维工具联动,实现自动化的故障检测、恢复及弹性伸缩等功能,进一步提升运维响应速度和准确性,降低人为干预带来的延误,甚至错误。可观测与自动化运维工具联动,实现自动化的故障检测、恢复及弹性伸缩等功能,进一步提升运维响应速度和准确性,降低人为干预带来的延误,甚至错误。 - [OPS07-01 创建可操作的告警](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0041.md): 风险等级高高关键策略告警需要做出响应,遵循告警可操作原则。消除无需响应的告警, 比如:磁盘IO 量瞬间飙升,CPU 使用率瞬间飙高,这类告警无需做出响应,对业务而言,意义就不大了。 遵循可操作性原则能避免很多误报。并且要定期统计和分析告警频率,识别高频告警,解决告警问题,清除明确的告警误报。告警需要做出响应,遵循告警可操作原则。消除无需响 - [OPS07-02 创建监控看板](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0042.md): 风险等级高高关键策略监控看板为您提供自定义查看监控数据的功能,将您关注的核心服务监控指标集中呈现在一张监控看板里,为您定制一个立体化的监控平台。同时监控看板还支持在一个监控项内对不同服务、不同维度的数据进行对比查看,实现不同云服务间性能数据对比查看。监控看板为您提供自定义查看监控数据的功能,将您关注的核心服务监控指标集中呈现在一张监控看板 - [OPS07-03 支持事件管理](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0043.md): 风险等级高高关键策略事件是需要干预的事情。当发生事件时,通过流程来处理。如何与团队沟通活动的状态?谁负责响应处置?使用哪些工具来缓解该事件?这些都是流程中需要回答的问题,并需要获得可靠的响应过程。流程必须中心化,并且可供参与工作负载的任何人使用。如果没有文档存储,可以使用源代码版本控制机制。优先通过自动化响应事件,避免占用业务交付和创新的 - [OPS07-04 支持故障恢复流程](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0044.md): 风险等级高高关键策略当现网发生故障时,既要快速恢复业务,又要降低影响,首先需要围绕故障全生命周期采取一系列控制流程,包含故障预防、故障发现、故障定位、故障恢复、故障复盘及持续改进(含故障演练),基于故障模式库,面向全流程、构建恢复能力、保证平均恢复时长(MTTR)的长效收敛,实现故障的快速恢复。当现网发生故障时,既要快速恢复业务,又要降低 - [OPS08-01 使用度量指标衡量运营目标](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0046.md): 风险等级高高关键策略定义清晰的运营成功的目标和 KPI,设置基线作为参考点并定期重新评估。与业务领导者和利益相关者确定服务的总体目标。确定各个运营团队的任务以及可能面临的挑战。并明确运营目标的关键绩效指标 (KPI),可能是客户满意度、TTM、平均问题解决时间等等。根据 KPI,识别关键指标和数据源。客户满意度可能是各种指标的组合,例如呼 - [OPS08-02 进行事故复盘和改进](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0047.md): 事故分析的目的是:规范和指导重大事故发生后,优化事故的输入、输出,确保事故回溯工作有效开展,回溯报告中发现的问题有效整改,总结的经验有效推广。风险等级高高关键策略故障发生后,通过对现网重大故障处理过程 Review 及根因进行分析和改进总结,规范整个恢复过程,实现对可用性和技术能力的提升。故障复盘的技术过程按照 RASA 法、Review - [OPS08-03 知识管理](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0048.md): 风险等级高高关键策略日益庞大的数据量和复杂的业务系统,对运维人员的要求越来越高。为了方便运维人员获取知识,学习和解决问题,运维知识管理能力变得必要。运维知识管理应集成丰富的运维知识,可以帮助运维人员快速解决问题,提高工作效率。一般通过运维知识库系统承载,运维人员可以轻松地查找和获取各种运维知识,包括网络配置、服务器管理、数据库维护等方面的 - [通过AOM助力系统运维能力提升,降低运维成本与难度](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0050.md): 某平台服务的认证驾驶员用户1000万人,货主用户500万人,集团业务覆盖全国339个主要城市,覆盖线路数量超过11万条,实现了全国多中心运营的架构。客户痛点:多云双活场景运维难保障:大规模集群场景,单个云厂商灾备不足以保障业务,需引入双活并行,故障零切换,过程中,客户自建运维平台能力较为欠缺,不足以满足运维需要无法采集云服务指标信息:客户 - [基于LTS采集多类端侧日志,问题全链路追踪分析和业务运营分析](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0051.md): 某公司核心业务专注于IT信息传播、技术交流、教育培训和专业技术人才服务。拥有超过3200万注册会员、超过1000家企业客户及合作伙伴。客户痛点:端侧采集工具不统一,不支持自定义域名上报,问题定位复杂Web、IOS、安卓、百度小程序、微信小程序等多类端侧日志无法使用同一家厂商工具采集,问题定位分析时,需在多个工具间需来回切换,增加了定位复杂 - [LTS助力某公司高效完成日常业务运维与等保合规](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0052.md): 某公司是一家拥有IT,汽车及新能源三大产业群的新技术民营企业。2022年8月,公司入选2022年《财富》世界500强排行榜。客户痛点:业务部门较多,日志量较大,项目管理较为困难云服务资源种类数量较多,监控指标和运维日志不熟悉,运维难度大等保合规要求日志长时间存储,运维部门较多,人员不足,自建ELK成本高解决方案:业务价值:全量日志接入:汽 - [软件开发生产线(CodeArts)](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0054.md): 软件开发生产线(CodeArts)是一站式、全流程、安全可信的DevSecOps平台,开箱即用,内置华为多年研发最佳实践,助力效能倍增和数字化转型。CodeArts由以下几个主要服务构成:需求管理:提供需求管理与团队协作服务,内置多种开箱即用的场景化需求模型和对象类型(需求/缺陷/任务等),可支撑IPD、DevOps、精益看板等多种研发模 - [资源编排服务(RFS)](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0055.md): 资源编排服务是完全支持业界事实标准Terraform(HCL + Provider)的新一代云服务资源终态编排引擎,在应用编排服务(AOS)基础上实现了生态、体验、特性的全新升级;资源编排服务基于业界开放生态HCL语法模板,实现云服务资源的自动化批量构建,帮助用户高效、安全、一致创建、管理和升级云服务资源,能有效提升资源管理效率,并降低资 - [云运维中心(COC)](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0056.md): 云运维中心(Cloud Operations Center,简称COC)为用户提供安全、高效的一站式智能运维平台,满足客户集中运维诉求。承载华为云确定性运维业务场景,提供变更管理、批量运维等核心特性,实现在安全合规的前提下,提升用户运维能力成熟度和云上运维效率。COC产品介绍:统一资源管理应用管理:提供应用和资源关联关系建模能力,满足用户 - [云监控中心(CES)](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0057.md): 云监控服务为用户提供一个针对弹性云服务器、带宽等资源的立体化监控平台。使您全面了解云上的资源使用情况、业务的运行状况,并及时收到异常告警做出反应,保证业务顺畅运行。云监控服务主要具有以下功能:自动监控:云监控服务不需要开通,在创建弹性云服务器等资源后监控服务会自动启动,您可以直接到云监控服务查看该资源运行状态并设置告警规则。主机监控:通过 - [云日志服务(LTS)](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0058.md): 云日志服务(Log Tank Service,简称LTS)是高性能、低成本、功能丰富、高可靠的日志平台,提供全栈日志采集、百亿日志秒搜、PB级存储、日志加工、可视化图表、告警和转储等功能,满足应用运维、等保合规和运营分析等应用场景需求。云日志服务提供多种接入方式实现海量日志接入LTS,支持日志搜索引擎、SQL分析引擎、日志加工引擎。端云全 - [应用运维管理(AOM2.0)](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0059.md): 应用运维管理(Application Operations Management,简称AOM)是云上应用的一站式立体化运维管理平台,融合云监控、云日志、应用性能、真实用户体验、后台链接数据等多维度可观测性数据源。提供应用资源统一管理、一站式可观测性分析和自动化运维方案,帮助用户及时发现故障,全面掌握应用、资源及业务的实时运行状况,提升企业 - [应用性能管理(APM)](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0060.md): 华为云应用性能管理服务(Application Performance Management,简称APM)帮助运维人员快速发现应用的性能瓶颈,以及故障根源的快速定位,为用户体验保驾护航。您无需修改代码,只需为应用安装一个APM Agent,就能够对该应用进行全方位监控,帮助您快速定位出错接口和慢接口、重现调用参数、发现系统瓶颈,从而大幅提 - [云堡垒机(CBH)](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0061.md): 云堡垒机(Cloud Bastion Host,CBH)是华为云的一款统一安全管控平台,为企业提供集中的账号(Account)、授权(Authorization)、认证(Authentication)和审计(Audit)管理服务。云堡垒机提供云计算安全管控的系统和组件,包含部门、用户、资源、策略、运维、审计等功能模块,集单点登录、统一资产 - [应用管理与运维平台(ServiceStage)](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0062.md): 应用管理与运维平台(ServiceStage)是面向企业的应用管理与运维平台,提供应用发布、部署、监控与运维等一站式解决方案。支持Java、Php、Python、Node.js、Docker、Tomcat技术栈。支持Apache ServiceComb Java Chassis(Java Chassis)、Spring Cloud等微服务 - [多活高可用(MAS)](https://support.huaweicloud.com/usermanual-architecture/architecture_06_0063.md): 多活高可用(MAS)的混沌工程(ChaosEngineering)是一种通过主动注入故障识别并修复系统未知隐患的工程实践。MAS-CAST混沌工程服务提供丰富的故障模式库,通过混沌实验编排攻击目标、攻击策略进行故障注入,支持添加背景流量和资源监控。同时在故障注入能力的基础上,通过体系化的流程和规范来创建故障演练,从而验证和提升系统可靠性和