
# OPS06-01 建立可观测性体系
可观测性（observability）最初是系统理论中的一个概念，指系统的状态能否被外部观察到和重现。随着云原生、微服务架构的发展，IT系统对可观测性的需求日益增强。业界对可观测性的定义：通常是指基于对复杂系统外部输出的了解，能够了解其内部状态或状况的程度。系统越可观测，定位问题根本原因的过程就越快速越准确，而无需进行额外的测试或编码。
- **风险等级**
  高
  
- **关键策略**
  可观测体系是围绕确定性恢复命题展开的，决定了确定性恢复能力构建与 SLO 达成。可观测体系能够直接决定一些故障的恢复时长，如下图所示，MTTR 平均恢复时长由平均发现时长、平均定界时长和平均处置时长三部分构成，而可观测能决定的是发现时长和定界时长。在一个事件里，MTTR 的恢复时长越短，那么它的整体 SLO 达成可能性就越高。
  MTTR平均恢复时长=平均发现时长+平均定界时长+平均处置时长
  
- **设计建议**
  面向 MTTR的可观测体系设计的核心逻辑就是寻找最短恢复路径。如下图所示案例，在故障恢复 MTTR 的逻辑中，当业务发生故障，从故障发现、到故障定级和影响面分析、再到故障定界定位和故障恢复，几乎全部依赖人工处理。要想缩短时间，本质上是监控即发现、监控即定级、监控系统定界、定界即恢复------如果能达成这样的设计就能够形成 MTTR 的最短路径。
  ![](https://support.huaweicloud.com/usermanual-architecture/zh-cn_image_0000001953741872.png)
  
 
