异地容灾

设计跨数据中心的高可用灾备系统

系统设计容灾高可用

系统演进路线

从备份脚本到可演练的异地容灾体系

第 1 版

备份恢复

数据库误删后,团队第一次意识到备份不等于容灾。

定时备份恢复脚本备份校验

能恢复数据,但恢复时间和丢失窗口都不可控。

第 2 版

同城热备

单机房故障影响服务,需要备用机房随时接管。

主备复制健康检查流量切换只读降级

RTO 开始可控,但数据一致性和切换权限变成关键。

第 3 版

跨地域容灾

城市级故障进入预案,数据和服务必须跨区域生存。

异步同步DNS/GSLB消息补偿对象存储复制

RPO、同步延迟和业务降级需要明确承诺。

生产版

演练驱动容灾

没有演练的预案无法信任,切流和回切必须定期验证。

故障演练自动化 Runbook恢复验证审计复盘

生产级容灾是一套组织流程和技术系统共同运行的能力。

课程简介

系统总览
容灾系统总览
围绕故障发现、切换、演练和多中心恢复能力设计系统。
运行
主站服务
数据复制
健康检查
故障
故障检测
流量切换
降级策略
恢复
灾备演练
数据校验
复盘改进

欢迎来到”系统设计 - 异地容灾”课程。

容灾不是“多买一套服务器”这么简单。真正的灾备系统要回答:机房断网后多久恢复?最多丢多少数据?谁有权切流?切过去后数据是否一致?恢复后怎么切回来?这些问题没有提前设计,事故发生时就只能靠人肉操作和运气。

这门课从一次机房级故障开始,逐步构建一套跨数据中心的高可用灾备系统。课程会围绕 RTO、RPO、多机房架构、数据同步、一致性、故障转移和演练验证展开。

课程会跟随一次事故复盘推进:先发现备份恢复太慢,再建设同城热备,然后扩展到异地灾备,最后把故障切换、回切、演练和恢复验证做成制度化能力。读者看到的不是静态架构图,而是一套业务连续性能力如何被迫长出来。

学习路线

  1. 容灾概述:从事故出发,理解容灾要解决的业务连续性问题。
  2. 容灾基础:定义 RTO、RPO、故障等级和恢复策略。
  3. 多机房架构:比较冷备、热备、同城双活、异地多活。
  4. 数据同步:设计数据库、缓存、对象存储和消息的跨地域同步。
  5. 故障转移:处理流量切换、服务接管、降级和回切。
  6. 数据一致性:在可用性、延迟和一致性之间做取舍。
  7. 容灾演练:通过演练验证预案,而不是等事故验证。
  8. 完整系统:总结最终架构、关键决策和上线检查清单。

学完后,你应该能从读者视角判断一套系统是否真正具备容灾能力,而不只是画了一个“备用机房”的架构图。

章节