本节摘要:可靠性量化为任务成功概率,串联结构让它天然脆弱,冗余设计是主要补救手段但自带代价与新失效模式。本节演算串联与并联可靠性,梳理冷备、热备、三模冗余的适用差异,走一遍故障模式分析流程,并用哈勃陀螺与伽利略天线两个案例说明"单点故障识别"为何是系统韧性的终极考题。
前两节搭好了平台,本节回答它的隐忧:无人维护的机器如何十五年不出致命故障。这一节的方法论后来外溢到核电、汽车与医疗器械,是航天工程对整个工业界最深的馈赠之一。
可靠性定义为规定条件下规定时间内完成规定功能的概率。它最反直觉的性质是串联衰减压单个设备可靠性尚可,串起来的系统会迅速垮掉。设每个设备可靠度为零点九九,十个串联,系统可靠度就是零点九九的十次方,约零点九零四——十份的"还不错"合起来只剩九成。设备数上百、每个九五折的系统,算出来是灾难。
串联与并联可靠性演算 串联(缺一不可): R = R1 × R2 × ... × Rn 例: 0.99^10 ≈ 0.904 0.95^100 ≈ 0.006 并联(一备一用, 双机热备): R = 1 - (1-R1)(1-R2) 例: 单机 0.99, 双机 → 1 - 0.0001 = 0.9999 三模冗余(表决器可靠为 1 的理想假设): 单机 0.99 → 三取二 ≈ 0.999702 工程含义: · 串联链的强度由最弱一环决定,长度本身就是敌人 · 并联让可靠度从"九十九"跳到"四个九",代价是质量、功耗、成本 · 上述公式默认切换与表决环节完美,真实系统要为这两者另付可靠性税
这笔账决定了航天可靠性工程的两大动作:一是压缩串联链长度——能集成就集成,能省环节就省环节;二是在无法压缩的关键节点上加并联冗余。注意公式的隐含假设:切换开关与表决机构自身百分之百可靠,现实中它们恰恰是新的单点。冗余不是免费的保险,是重新分配失效概率的位置与模式。
冷备份是故障后断电切换到备份件,省功耗、备份件不被耗损,代价是需要故障检测加切换动作,切换过程有服务中断窗口,适合数传放大器、加热器这类允许短暂中断的设备。热备份是主备同时通电工作,切换零时延,代价是双份功耗与备份件同步老化,适合姿控计算机这类不允许中断的核心。三模冗余则是同一输入喂给三个通道,输出按多数表决——单个通道被辐射翻转出的错误会被立即否决,代价是三倍硬件加上表决器这个新单点。星务计算机与关键控制逻辑常用三模加纠错码的组合拳。
冗余设计的高阶形态是交叉备份与功能冗余:姿控的轮子坏一个,控制矩阵重新分配其余轮子的力矩(阿波罗与哈勃都用过轮子重构);化学推力器坏一批,电推进顶上维持轨道。设计交叉备份时最容易犯的错误是"共因失效"——两台互为备份的设备用同批次芯片、同一电源母线、同一软件版本,一个共因事件(雷击式的单粒子暴、同一处代码缺陷)同时打穿主备。防共因是冗余设计的头号纪律:批次隔离、供电隔离、版本隔离,缺一不可。

冗余加在哪里,不能靠拍脑袋,要靠系统的故障模式与影响分析。流程是自下而上的穷举:对每个功能单元列出所有可能的失效模式(开路、短路、卡死、漂移、软件跑飞),逐项分析其影响传播路径、检测手段与应对措施,最后按严重度与发生概率分级,对灾难性单点或加冗余、或重新设计、或证明其发生概率低到可接受。这套方法与自上而下的功能危险分析(从顶层功能倒推哪些故障会致命)配合使用,构成可靠性设计的完整闭环。
分析完成后产出可靠性框图、故障树与关键项目清单,它们贯穿研制全程:设计评审查单点、试验大纲覆盖关键项、在轨运行按故障预案演练。第九章讲项目管理时会看到,这套文件体系与评审制度如何咬合成"防止低级失误"的制度机器。
从整星可靠度到每颗螺钉,中间还有两道工序。第一道是可靠性分配:任务总体要求十五年期可靠度零点八,就要按串联结构把指标逐级摊给分系统、单机、组件——寿命短摊的严,技术新摊的严,可维修或可降级的摊得松,分配结果就是各分系统的军令状。分配不是数学游戏,它强迫每个承制方在方案阶段就回答"我的零点九几从哪来":靠成熟度、靠冗余、还是靠降额。
第二道是环境应力筛选。元器件装机前要做老化与筛选,把"婴儿死亡率"曲线的早期失效剔除在总装之前——这背后是著名的浴盆曲线:产品失效集中在早期与耗损期,中间是一段低平的偶然失效区。整机则按验收级与鉴定级两档做环境试验:鉴定级用比飞行环境更严酷的量级证明设计余量,验收级用真实量级剔除工艺缺陷。"试验要像飞行一样严,飞行才能像试验一样稳"——这句口号对应的具体做法,是把每一台单机的振动、热真空、电磁兼容试验记录做成可追溯的档案,出厂评审时逐项勾验。第九章的质量管理一节会回到这套档案制度。
哈勃空间望远镜的陀螺故事是冗余设计的教科书。哈勃用六只陀螺做三轴冗余(每轴两只),设计时认为万无一失;在轨数年后陀螺接二连三失效,一九九九年底一度只剩三只勉强维持,整望远镜被迫关闭进入安全模式待援——原因是陀螺内部的挠性轴承磨损这种共因机理,六只一起老化,冗余形同虚设。救援靠航天飞机更换新陀螺(第六章的出舱维修会再讲这个故事),教训则是:冗余数量挡不住共同失效机理,可靠性设计必须穿透到失效物理层面。后续航天器的陀螺换了技术路线并改进冗余管理,哈勃自己也在后续维修任务中换装了新体制陀螺。
伽利略木星探测器的天线事件则是另一个极端:高增益天线展开机构的三根支柱中一根卡死(销钉与润滑层在多年存储与飞行后失去间隙),天线只张开一部分,数传能力掉了几个数量级。工程团队的抢救堪称传奇——靠深空网升级接收能力、在轨反复开关温度循环"敲打"机构、用磁带机缓存加极限压缩,最终取回了七成左右的计划科学数据。但对设计者的教训朴素:凡是活动的、又是单点的,就是全系统最脆弱的地方。此后深空任务的天线展开普遍增加冗余激励与地面全程验证。
这两个案例连起来读,可靠性的要义就清楚了:第一,单点故障清单要年年更新,存储老化、共因机理这些"慢性杀手"最容易在设计冻结后被遗忘;第二,冗余挡不住所有坏法,软件、接口与切换逻辑自己是新故障源;第三,在轨抢救能力(预案、参数调整、软件上注)是最后的保险层——它便宜得惊人,却常被忽视为"软实力"。
⚠️ 可靠性工作的最大误区:把可靠性当成纸面指标,评审前补数据。真正的可靠性是设计出来的——单点清单在方案阶段就要逼出来,等到正样再想加备份,质量、布局、测试全都要推倒重来,没有一家型号的进度付得起这个代价。
第四章收官。平台齐备、器官可靠,但一切机动与维持最终都指向同一个瓶颈——推进剂。第五章进入全册技术含量最高的演化现场:从化学燃烧的极限,到电推进的换道,再到试图跳出火箭方程的新概念。