大促前一晚压测,一个重要下游依赖突然超时,我们的服务跟着雪崩,错误率冲到 40%。复盘时发现:我们根本没有像样的降级,依赖挂了就硬等、硬等就堆积、堆积就拖死。这次事故后,我把降级与兜底当成架构的一等公民来设计。 降级层次:从浅到深 降级不是"有/无"两个状态,而是分层的连续体。我按影响面从轻到重设计
故障演练那天,我们丢了 400 多条缓存 key 公司 7 月底做了一次故障演练,运维在预发环境把 Redis 主节点的进程 kill 掉,看哨兵能不能自动切换。切是切成功了,但演练结束后比对数据,主库的 key 数量是 12,480,331,切过去之后新主库只有 12,479,905,少了 426