前置检查项
| check项描述 | 检查方式 | 检查原因 | 检查不通过时的处理 |
|---|---|---|---|
| 数据面IP需要使用ping测试互通,port使用curl命令测试互通,主备集群监听的端口都需要从对端进行核查。 | 主备集群所有节点进行双向测试,IP为数据面IP。 ping <ip> CN curl <ip>:8001 DN curl <ip>:30501 curl <ip>:30505 | 切换前原主集群的baseport+1,+5端口处于使用状态,但备集群的baseport+1,+5端口并不在使用状态。检查可确保切换完成后主备集群连接正常。 | 端口确认放通后,重新进行检测。 |
| 集群状态(Normal/Degraded)。 | 可通过cm_ctl query -Cvp进行查询。 | 主备集群有其中一个集群处于unavailable状态会导致容灾切换失败。 | 集群异常排除后重新查询。 |
| 观察监控指标RPO是否小于10秒,RTO<=1秒。 | 可通过om_agent接口POST /v1/om/agent/mgr/cluster/streaming_disaster_recovery_query进行查询。 对接adaptor的情况下可以调用"streaming_disaster_recovery_query"接口,直接观察执行结果。 | RPO指标过高说明有较多日志需要传到灾备集群,RTO指标过高会导致切换过程有较多日志需要回放。 | 等待指标下降到要求规格内。 |
| 容灾状态是否主集群处于“增量同步中/archive”,灾备集群处于“增量恢复中/recovery”。 | 可通过om_agent接口POST /v1/om/agent/mgr/cluster/streaming_disaster_recovery_query进行查询。 对接adaptor的情况下可以调用"streaming_disaster_recovery_query"接口,直接观察执行结果。 | 不正常的容灾状态会导致容灾切换执行失败。 | 容灾异常排除后重新查询。 |
| 一致性点推进检查。 | cm_ctl query -vg | grep Global_target_barrierId Global_target_barrierId: csn_000000000000017259643_1707278427941 cm_ctl query -vg | grep Global_target_barrierId Global_target_barrierId: csn_000000000000017259645_1707278429543 | 一致性点推进异常会导致灾备集群日志回放异常。 | - |