Google Cloud在2026年9月17日调整Cloud SQL高级容灾流程。MySQL与PostgreSQL在完成switchover或DR副本故障转移后,将通过独立的异步操作启用时间点恢复(PITR),不再让PITR配置阻塞主从角色切换。
这项变化有助于缩短容灾操作的完成时间,但它没有消除新主实例建立恢复基线所需的备份过程。数据库团队需要同时观察业务恢复时间和PITR重新可用时间,不能把两者视为同一个指标。

异步启用改变了容灾操作的等待路径
过去容灾切换流程需要等待PITR启用步骤,切换操作本身因此被后续恢复配置拖长。新流程先完成主从角色变化,再在后台配置并启用PITR,使应用更早获得新的主实例。
该变化同时适用于Cloud SQL for MySQL和Cloud SQL for PostgreSQL的高级容灾。优化的是控制面操作顺序,不是复制延迟、DNS刷新或应用重连速度,端到端恢复时间仍取决于完整链路。
新主库仍需要备份才能恢复PITR覆盖
DR副本被提升后,Cloud SQL会立即为新的主实例创建备份,备份完成后PITR才完全启用。官方文档说明,这一步通常需要5至15分钟,具体取决于磁盘大小。
在这段时间内,新主实例可以承担业务,但PITR暂不可用,恢复覆盖也从备份完成后才开始。更快切换不等于切换后的每一分钟都已经具备时间点恢复能力,高风险写入应根据业务要求安排。
switchover与故障转移的数据风险不同
switchover用于有计划地反转主实例和DR副本角色,官方定义为零数据丢失操作,适合容灾演练或恢复原有部署方向。执行时应避开高事务量时段,也不要与自动备份或高可用配置变更并行。
副本故障转移用于区域故障等紧急场景,会立即提升DR副本。如果异步复制尚有延迟,新副本可能缺少旧主库的最后一部分数据。紧急故障转移可能产生数据丢失,不能用switchover的零丢失承诺来描述。
Enterprise Plus和跨区域副本仍是前置条件
高级容灾只支持Cloud SQL Enterprise Plus。主实例必须已启用PITR并指定跨区域的直接只读副本作为DR副本;PostgreSQL要求版本12或更高,MySQL要求8.0.31或更高且主从版本一致。
如果使用DNS写入端点,主实例与DR副本的SSL配置必须一致。没有使用写入端点的应用,则需要在切换后把连接指向新主库IP。异步PITR不会自动修复版本、网络或TLS配置不一致。
演练需要分别记录RTO与恢复覆盖时间
容灾演练应记录操作提交、角色完成切换、DNS或连接池恢复、应用探针成功、备份完成及PITR可用等多个时间点。这样才能区分数据库控制面加速和应用侧剩余瓶颈。
切换前还应创建按需备份,确认DR副本健康、复制延迟在容许范围内,并验证Private Service Connect出站和VPC Service Controls边界。业务恢复成功且PITR重新可用后,才算整个容灾流程完成。


