【摘要】事故现场 这次的背景是生产环境 Nacos 集群 3 个节点,其中一个节点因底层硬件问题需要重启。按理说,集群架构天然支持节点故障转移,但重启后大量服务开始报不健康告警,最终引发连锁反应——大面积服务重启。 问题的本质是:Nacos 服务端的一次短暂抖动,怎么就传导成了客户端的雪崩? 针对这次的na 阅读全文