5.1 可靠性设计RAS与可用性指标


5.1 可靠性设计RAS与可用性指标

本节摘要:RAS 即可靠性(Reliability)、可用性(Availability)、可维护性(Serviceability)三兄弟。本节建立可靠性的量化语言——MTBF、MTTR、可用性的定义与计算,串联并联系统的可靠性合成,解读"几个九"的时间预算,并给出 DCS 可靠性设计的四道防线与全生命周期维护观。

先把形容词变成数字

"这套系统很可靠"不是工程语言,工程语言是三个量。

MTBF(平均无故障时间):两次相邻故障之间的平均运行时间,由元器件失效率与设计裕量决定,DCS 控制器的 MTBF 以十万小时量级计。

MTTR(平均修复时间):从故障发生到恢复功能的平均时间,包括发现、定位、更换、确认。模块化设计与热插拔把 MTTR 从小时级压到分钟级——热插拔 I/O 模块、带电更换电源,都是 MTTR 工程。

可用性:稳态下系统处于可执行规定功能状态的概率,工程近似为 A 等于 MTBF 除以 MTBF 加 MTTR 之和。

这个公式藏着两条独立的可靠性路线:让故障少发生(增大 MTBF)与让故障快修复(减小 MTTR)。冗余的深层价值正在于后者:冗余系统里单点故障不导致功能丧失,修复可以在运行中完成,"修复时间"对可用性的伤害被急剧压缩。

几个九:可用性的时间预算

把可用性换算成年度停机时间,数字立即有了体感:

可用性 年不可用时间 对应场景感觉
99% 约 87.6 小时 普通设备
99.9% 约 8.8 小时 单机带备件
99.99% 约 52.6 分钟 冗余 DCS 的常规承诺
99.999% 约 5.3 分钟 核电级、电信级

注意这些"停机时间"指功能丧失时间。冗余配置下单模块故障不算停机——一台控制器坏了,另一台顶上,功能未丧失,系统继续"可用",坏模块在下一个检修窗口更换即可。这就是为什么主流 DCS 冗余配置敢承诺 99.99% 以上:设计目标不是"零件不坏",而是"零件坏了系统不倒"。

算一笔账体会 MTTR 的杠杆:单控制器 MTBF 十万小时、MTTR 八小时,可用性约 99.992%。做热备冗余后,功能丧失需要主备同时故障,概率是单台概率的平方量级,可用性再上一个台阶;而如果 MTTR 恶化到四十八小时(备件在路上),可用性立刻崩到 99.95% 以下——备件策略与响应速度是可用性的隐形支柱,这在生命周期管理里是重头戏。

串联与并联:系统可靠性的合成

系统的可用性由零部件按结构合成。串联系统(任何一件坏则系统坏)的可用性等于各环节可用性的乘积——五个 99.99% 的环节串联,总体约 99.95%,环节越多越脆弱,这解释了信号链上每个单点都值得警惕。并联系统(冗余,任一存活即可)的不可用性等于各环节不可用性的乘积——两个 99.9% 的控制器并联,不可用性为十万分之一乘以千分之一量级,可用性跳到 99.9999% 量级。

这张账直接给出设计纪律:串联链上消灭单点,关键环节做并联冗余。第二章说过"冗余的最后一致"——控制器冗余了,I/O 单点,串联链照样断。工程上的对应做法是关键回路测量双通道甚至三通道分散布置、执行侧双电磁阀,让冗余贯穿整条链。

图:可用性金字塔与年度停机预算

图:可用性金字塔与年度停机预算

可维护性:被低估的第三兄弟

Serviceability 常被中文资料弱化成"可维修",它实际是一组设计能力:热插拔(运行中更换模块)、通道级诊断(坏到哪一路一目了然,见 3.2 节)、状态预测(风扇转速、温度趋势预警)、模块化备件(一型号备件覆盖多槽位)。可维护性好的系统,MTTR 以分钟计;差的系统,一次故障要停装置排查半天。采购谈判里在 MTBF 数字上讨价还价的人很多,追问热插拔覆盖范围与诊断颗粒度的人很少——而后者才是现场时间的主宰。

全生命周期:可靠性的时间维度

DCS 的服役期普遍超过十五年,可靠性不是交付时的快照,而是随时间演化的曲线。生命周期管理的四件事:备件策略(按失效模型储备易损件,停产模块提前囤货或寻找替代认证);版本管理(固件与组态的版本受控,升级做兼容性验证与回退预案);劣化监测(风扇、电源、电池等寿命件的定期更换,不以"还能转"为标准而以寿命数据为标准);知识传承(组态文档、回路档案、故障案例随系统移交,人可以流动,档案不能断)。最后一件最容易被忽视——多少装置的联锁逻辑只活在退休工程师的脑子里,那是比任何单点硬件都危险的风险。

⚠️ 数字警觉:厂商宣传的"可用性 99.999%"通常指特定冗余配置、特定环境条件下的计算值。评估时要问清:计算口径(含不含 I/O 与网络)、是否计入共因失效、现场环境假设。把宣传值打八折做设计输入,是老工程师的习惯。

本节要点回顾

  • 三个量:MTBF 管故障频率,MTTR 管恢复速度,可用性等于 MTBF 除以 MTBF 加 MTTR
  • 两条路线:减少故障(增大 MTBF)与加快修复(减小 MTTR),冗余的深层价值在后者
  • 四个九对应年度停机约 52.6 分钟;冗余配置下零件故障不等于功能丧失
  • 串联相乘、并联互乘:串联链消灭单点,冗余要贯穿控制器、网络、I/O、执行器全链
  • 可维护性三件套:热插拔、通道级诊断、模块化备件,它们决定现场时间
  • 生命周期四件事:备件、版本、劣化监测、知识传承;档案断档是最大的隐形风险

量化的语言就位,下一节拆冗余的内部机理——主备如何同步、何时切换、凭什么无扰动。

可用性指标的行业对标

不同装置等级对控制系统可用性的要求量化后差异惊人,给一张对标表。一般辅助装置:可用性 99.9%(年停机 8.8 小时内可接受);主要生产装置:99.99%(年 53 分钟);大型连续装置(乙烯、炼油主装置):99.995% 以上(年 26 分钟);保护层(SIS)按 SIL 等级另算(SIL2 的要求不是可用率而是危险失效概率)。这张表的计算基础:可用性=MTBF/(MTBF+MTTR),提升路径两条——拉长 MTBF(更好的部件加冗余)或压缩 MTTR(备件本地化、维修训练、远程诊断)。给项目经理的用途:合同里"可用性 99.9%"与"99.99%"的差价可能占系统投资的相当比例,按装置等级买对应的可用性而不是无脑顶配——可靠性预算要花在刀刃上,刀刃由工艺后果的严重度决定。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U