为什么不能买买买了

作者: Quanta Yuan

来源: 漫话编程

发布日期: 2019-04-02 12:49:54

文章讨论了系统可用性的概念,包括高可用性的重要性及其衡量标准,如MTTR、MTTF、MTBF等指标。同时,文章还提到了SLA(服务级别协议)在衡量系统高可用性中的作用,以及影响系统可用性的多种因素和保障高可用性的多种层面。

在一个阳光明媚的周二下午,我正沉迷于一款敲好玩的游戏,这时候女朋友打来电话。晚上下班后,女朋友回到家里面和我说,发现淘宝无法访问的十几分钟后又可以了。

系统的可用性,英文名字为 System Usability,即系统服务不中断运行时间占实际运行时间的比例。所以,可用性其实是一个百分比,如 99.9%。我们通常会听说一个词:高可用,其实指的就是高可用性。高可用指的就是系统服务不中断运行时间占实际运行时间的占比更大。要了解可用性,躲不开的三个体现系统可用性的重要指标:MTTR、MTTF、MTBF。

MTTF 即 Mean Time To Failure,中文为:平均无故障时间。指系统无故障运行的平均时间,取所有从系统开始正常运行到发生故障之间的时间段的平均值。MTTR 即 Mean Time To Repair,中文为:平均修复时间,指系统从发生故障到维修结束之间的时间段的平均值。

MTBF 即 Mean Time Between Failure,中文为:平均失效间隔,指系统两次故障发生时间之间的时间段的平均值。衡量系统的高可用性,一般通过 SLA,全称 Service Level Agrement,也就是有几个 9 的高可用性。我们经常可以看到很多公司会宣称自己的系统可以达到 99.99%、99.999% 等。工业界通常通过统计故障发生到恢复的时间的方法来测量 SLA。

一般以年度为单位,统计一年内的系统不可用总时长。具体对应关系如下表:墨菲定律说 “会出错的事总会出错”,可用性做到 100 是可望而不可及的。对于 SLA 指标来说,9 的数字越多可用性越高,宕机时间越少,系统就可以在给定的时刻内高比例地正常工作。然而对系统的挑战就越大,投入的成本也会越高。比如 5 个 9 要求系统每年只宕机 5 分钟左右,而 4 个 9 要求每年宕机时间不超过一个小时。

这就使得系统需要在设计、基础设施、数据备份等不同层面采取多种方式,甚至增加基础设施投资来保证可用性。影响可用性的因素有很多,包括系统故障、基础设施故障、数据故障、安全攻击、系统压力等等。

可用性的保障涉及到很多层面,其中包括但不限于了:软件的设计、编码、测试、上线和软件配置管理的水平;工程师的人员技能水平;运维的管理和技术水平;数据中心的运营管理水平;依赖于第三方服务的管理水平;对待技术的态度;一个公司的工程文化;领导者对工程的尊重。保障系统的高可用,并不是一个简单的事情,上表中列举的也只是其中一部分方法论,真正的保证高可用,还是需要大量实践的!

UUID: 5d0592ae-ef59-49cd-a6e3-60eec8c9f33b

原始文件名: /home/andie/dev/tudou/annot/AI语料库-20240917-V2/AI语料库/中科院物理所公众号-pdf2txt/2019/中科院物理所_2019-04-02_「转」为什么不能买买买了.txt

是否为广告: 否

处理费用: 0.0035 元