简介
在分布式系统中,服务之间通过网络进行远程调用,而网络本身的不可靠性、服务节点的故障、依赖资源的瓶颈等因素,都可能导致服务调用失败。如果缺少容错机制,一次局部的故障可能会沿着调用链向上传播,引发请求堆积、资源耗尽,最终演变为整个系统的雪崩。
服务容错的目标是在故障发生时,通过限流、降级、熔断、隔离、重试等手段,控制故障的影响范围,保障系统在部分组件异常的情况下仍能对外提供核心服务,提升系统的弹性和可用性。
2022/4/20大约 19 分钟
在分布式系统中,服务之间通过网络进行远程调用,而网络本身的不可靠性、服务节点的故障、依赖资源的瓶颈等因素,都可能导致服务调用失败。如果缺少容错机制,一次局部的故障可能会沿着调用链向上传播,引发请求堆积、资源耗尽,最终演变为整个系统的雪崩。
服务容错的目标是在故障发生时,通过限流、降级、熔断、隔离、重试等手段,控制故障的影响范围,保障系统在部分组件异常的情况下仍能对外提供核心服务,提升系统的弹性和可用性。
链路追踪系统广义的概念是:由数据采集、数据处理和数据展示三个相对独立的模块所构成的分布式追踪系统;链路追踪系统狭义的概念是:特指链路追踪的数据采集。譬如 Spring Cloud Sleuth 就属于狭义的链路追踪系统,通常会搭配 Zipkin 作为数据展示,搭配 Elasticsearch 作为数据存储来组合使用;而 Zipkin、Pinpoint、SkyWalking、CAT 都属于广义的链路追踪系统。