Special Issue: Tianwen-2

The Fault Diagnosis and Recovery Method Based on Deep Space Onboard Computer Systems

  • Zhiling YE ,
  • Tian LAN ,
  • Fang DONG
Expand
  • Beijing Institute of Spacecraft System Engineering, Beijing 100094, China

Online published: 2025-11-04

Abstract

Deep space probes typically operate at vast distances from Earth, leading to prolonged communication delays and significantly reduced real-time monitoring and control capabilities. In many cases, telemetry data cannot be downlinked or can only be transmitted at extremely low rates. Therefore, deep space probes must possess autonomous fault diagnosis and long-term operational capabilities to reduce dependence on ground-based telemetry analysis. Under limited downlink conditions, it is essential for probes to transmit critical health status information in a timely manner to support ground-based flight control. Considering that the onboard computer system of deep space probes adopts a hybrid centralized-distributed architecture, this paper proposes a hierarchical approach to fault diagnosis and recovery at the module level, device level, and system level. This multi-level strategy enables multi-dimensional fault detection, which reduces the probability of missed or incorrect diagnoses. It also facilitates collaborative fault diagnosis and recovery among multiple subsystems, maximizing the utilization of onboard resources. This work lays a foundational methodology for future research and development in fault diagnosis and recovery for deep space onboard computer systems.

Cite this article

Zhiling YE , Tian LAN , Fang DONG . The Fault Diagnosis and Recovery Method Based on Deep Space Onboard Computer Systems[J]. Journal of Space Science and Experiment, 2025 , 2(4) : 49 -57 . DOI: 10.19963/j.cnki.2097-4302.2025.04.006

0 引 言

深空探测是当今世界高新科技中极具挑战性的领域之一,它不仅是一个国家综合国力和创新能力的重要标志,还对保障国家安全、促进科技发展、提升国家软实力以及国际影响力具有重要的意义。近年来,美国、俄罗斯、欧洲、日本等国家和地区都在实施各自的深空探测计划,并将其作为航天领域的重点发展方向之一。中国“十三五”规划纲要提出“科技创新2030-重大项目”,就包含了“深空探测及空间飞行器在轨服务与维护系统”。在深空探测任务中,航天器最远点可能存在长达几十分钟的通信时延。对于故障这类实时事件,通信时延极易造成不可挽回的损失,轻则错失探测时机,重则导致整个探测任务失败。因此,要求深空探测航天器必须在长时间没有监控的情况下,自主完成飞行任务的决策、任务规划的执行、故障的自主防护与健康状况的保持等工作。美国国家航空航天局的“新盛世”计划把智能自主技术放在首位,使深空探测航天器能够自主完成导航控制、数据处理、故障判断和部分重构与维修工作。
为了实现自主故障诊断,国内外学者开展了一系列研究。文献[1]提出了一种主动容错姿态稳定控制的理论框架,并将其应用于挠性航天器,解决了执行机构存在严重的部分失效和外部干扰时的容错控制器设计难题。文献[2]研究了基于观测器技术的过驱动航天器执行机构故障诊断方法,考虑了执行机构及转动惯量不确定性,利用迭代学习观测器设计了一种改进的执行机构故障诊断方案。文献[3]针对多重加性故障隔离问题,提出了一种基于卡尔曼滤波器的故障检测与隔离算法,实现了多重故障检测与隔离。文献[4]针对推力器故障,提出了基于多观测器的自主故障检测、隔离与重构策略,在故障检测过程中重点考虑了推进驱动电子引起的时延和推进器上升时间存在的不确定性。文献[5]利用动态贝叶斯网络的特征建模与推理能力,研究了故障检测、辨识与恢复策略。以上方法均可以实现航天器的有效故障诊断,但尚未针对深空星载计算机系统的故障诊断策略进行研究。
由于重量、体积以及功耗等严重受限,深空探测器配置较为简单,导致星载计算机系统以实用为主,现有复杂的故障诊断模型难以在深空探测器中应用。因此,针对深空星载计算机系统的特点,充分利用已有资源,设计一套故障诊断体系显得尤为重要。

1 深空星载计算机系统特点

根据深空探测任务特点及约束条件,计算机系统采用了集中与分布式相结合的体系结构。单机设备中,集成了多个功能模块,由内部总线相连。分布式的总线结构使用一条公共的数据总线(或网络)连接所有的处理器单元。与其他分布式体系结构相比,该系统具有模块化程度高、易于扩展、容错性强以及结构简单等优势,目前广泛应用于航天器数管分系统[6]

1.1 分布式体系结构

分布式体系结构中的总线结构使用一条公共的数据总线连接所有的处理器单元(见图1)。该数据总线将作为总线控制器(Bus Controller,BC)的系统管理单元(System Manage Unit,SMU)与各类远程终端(Remote Terminal Unit,RT)相连接。BC是总线系统中负责组织信息传输的核心终端,其他不作为总线控制器的所有终端即为RT[7]。数管分系统将航天器的指令分配、数据采集和数据处理能力分配到多个分散配置的终端,甚至是不同的分系统(如控制分系统、有效载荷分系统)中去实现。相较于集中式系统,星载计算机的分布式体系结构简化了接口、数据传输、软件和测试,既利于模块化设计,又便于功能扩展和重新配置。
图 1 分布式体系结构

Fig.1 Distributed architecture

1.2 集中式模块设计

通过对整器资源进行跨分系统综合利用,星载计算机对整器功能和信息流进行合理设计、划分和管理,实现信息的集中管理和分类处理,最大限度地集成电子设备功能。在功能需求分析的基础上,通过机、电、热一体化设计和软硬件协同设计,优化资源分配,减少系统间接口和硬件资源消耗,将传统的数管设备(如中央单元、遥控单元、总线控制器、高速复接器、大容量存储器)及其他分系统设备(如配电器、火工品控制器、热控加热器等)集成为一台单机SMU,实现系统的轻小型化。
SMU是数管分系统[8]的核心,属于长期加电设备。其通过测控分系统接收地面发送的遥控指令和注入数据,执行遥控直接指令,完成遥控间接指令和注入数据的分配、配电、火工品管理以及加热回路控制驱动;控制串行数据总线的运行,提供星上基准时间,采集各类遥测数据组帧下行;同时具备多路数据复接、大容量存储等功能。SMU由以下8个功能模块组成(见图2):中央处理器模块、供配电管理模块、火工品管理模块、遥控处理模块、间接指令模块、热控管理模块、遥测采集模块和复接存储模块。
图 2 单机模块化设计

Fig.2 Modular design of device

2 故障诊断与过程恢复方法

鉴于深空星载计算机系统采用了集中式模块设计与分布式相结合的体系结构,可以结合此结构特性,引入模块级、单机级、系统级的三级分层思想,开展故障诊断与恢复。故障诊断包括故障检测、故障隔离和故障辨识三大任务[9],为后续过程恢复提供依据(见图3)。
图 3 故障诊断及过程恢复流程

Fig.3 Fault diagnosis and recovery process flow

国际自动控制联合会[10]约定:
(1)故障检测就是判断系统是否发生了故障。
(2)故障隔离就是判断故障的类型和硬件位置。
(3)故障辨识就是进一步判断故障的幅值、时变特性等。
(4)过程恢复则是故障处理和系统维修的过程。
由于故障辨识并非必需任务,因而把故障诊断等同于故障检测与隔离。基于分层思想开展的故障诊断与恢复研究,重点在于论述各层级的故障诊断与过程恢复方法。

2.1 模块级故障诊断与过程恢复方法

模块故障诊断方法是利用定量诊断方法中的基于解析模型的方法[11]。该方法推理以模型结构和模型参数为推理起点,假设输入/输出数据符合特定模型结构,如状态空间模型,且模型参数已知。多数故障诊断方法预设系统为线性系统,对于非线性系统则通过线性化处理获得近似的线性模型。通过对输入的模块测点利用故障诊断模型进行故障判断,一旦发现故障,则利用处置策略进行过程恢复。基于测点的故障诊断与恢复流程如图4所示。
图 4 基于测点的故障诊断与恢复流程

Fig.4 Fault diagnosis and recovery process based on telemetry points

2.1.1 模块测点设计的故障诊断

针对单机的模块设计,开展模块故障可识别设计的研究。基于故障影响变量的测点优化配置[12],采用以下思路:首先汇总不可识别的故障集合,然后针对集合中的各故障,分别分析使其可识别所需的测点,进而对分析得到的测点集合进行最小冲突集计算,最终得到使故障具有可识别性的最优测点集。以SMU为例,利用可重组系统的可识别性设计方法[13],针对冗余模块的切换,得到使各模块故障可识别性的最优测点集。该测点集的主要元素包括模块的名称、测点名称、测点类型、数据长度、数据类型、单位及正常值范围等。如表1所示,通过测点的取值情况,可以判断模块的健康状态,从而作为模块故障诊断与恢复的依据。
表 1 模块故障测点集

Table 1 Telemetry point set for module fault diagnosis

模块名称 测点名称 测点类型 长度/Byte 数据类型 单位 加电正常值范围 断电正常值范围
供配电管理模块A SMU主份一次电源开关状态 状态量 0.125 无符号整型 [1.0,1.0] [0,0]
SMU主份、12 V电压 模拟量 1.000 无符号整型 V [11.5,13.5] [0,0.5]
供配电管理模块B SMU备份一次电源开关状态 状态量 0.125 无符号整型 [1.0,1.0] [0,0]
SMU备份、12 V电压 模拟量 1.000 无符号整型 V [11.5,13.5] [0,0.5]

2.1.2 模块冗余设计的故障恢复方法

模块冗余设计是提高星载计算机可靠性与安全性的核心手段,也是实现故障后快速恢复的基础保障[14]。以SMU为例,单机内的8个模块根据功能特点,均进行了不同程度的备份冗余及切换设计(见图5):
图 5 模块冗余及切换设计

Fig.5 Module redundancy and switching design

(1)供配电管理模块双模块热备份。
(2)遥控处理模块双模块热备份。
(3)火工品管理模块双模块热备份。
(4)间接指令模块采用双机热备份。
(5)中央处理器模块采用双模块冷备份设计,可通过指令切换模块工作。
(6)复接存储模块采取双模块冷备份设计,复接及存储模块与中央处理器模块可同时加断电,同时单模块也可单独加断电。
(7)遥测采集模块采用双模块冷备份,可通过指令切换模块工作。
(8)热控管理模块采用冷备份,可通过指令切换模块工作。主备模块均能对所有热控通道进行控制,与遥测采集模块同时切换。
模块故障诊断线性模型[15]可以用一个矩阵来描述,包括以下要素:故障事件,故障判据前提条件及故障判据、故障判据的逻辑关系、测点类型、阈值上下限以及阈值关系符(如TM_CMP_EQUEL表示等于门限值,适用于分层值门限;TM_CMP_OVER表示在上限和下限之外,不含上限和下限)。以SMU为例,其模块故障诊断矩阵如表2所示。在主备份电源模块加电的前提下,通过评估电源模块的电压状态,进而判断主备份模块的健康状态。
表 2 模块故障诊断矩阵

Table 2 Module fault diagnosis matrix

事件
代号
事件名称 判据类型 判据描述 逻辑
关系
持续
时间/s
测点名称 阈值关系符 阈值
下限
阈值
上限
SMU001 SMU内部主份电源模块异常 前提条件组合 SMU主份电源模块加电 9 SMU主份一次电源开关状态 TM_CMP_EQUEL 1
判据 SMU内部主份电源供电电压遥测超限 9 SMU主份、12.0 V电压 TM_CMP_OVER C3 E5
SMU主份、12.0 V电压 B7 D9
SMU主份、5.2 V电压 BB E6
SMU002 SMU内部备份电源模块异常 前提条件组合 SMU备份电源模块加电 9 SMU备份一次电源开关状态 TM_CMP_EQUEL 1
判据 SMU内部备份电源供电电压遥测超限 9 SMU备份、12.0 V电压 TM_CMP_OVER C3 E5
SMU备份、12.0 V电压 B7 D9
SMU备、5.2 V电压 BB E6
基于模块冗余设计的故障过程恢复可以用一个矩阵来描述,该矩阵包括故障事件名称、事件信息、故障处置策略等。以SMU为例,其模块故障处置策略如表3所示。当通过测点信息诊断出SMU内部主份电源模块异常时,将对主份电源模块及其相关使用主份电源的模块开展切备份处置。通过基于模块的测点与冗余设计,利用故障诊断模型,最终实现过程恢复策略。
表 3 模块故障处置策略

Table 3 Module fault handling strategies

事件代号 事件名称 事件信息 故障处置 备注
事件编码/
4 Byte
事件附属
信息/4 Byte
措施 与上一项
间隔/s
TMSH001 SMU内部主份电源
模块异常(工作在主份)
00000001H 星时 设置自主处置为禁止 1 切备份工作
(自主/地面)
发送TCS002(SMU主份电源模块断电) 1
发送TCS011(SMU CPU模块主份断电) 1
发送TCS012(SMU CPU模块备份加电) 1
发送TCS019 (SMU遥测采集和热控模块主备份断电) 1
发送TCS018(SMU遥测采集和热控模块备份加电) 1
发送TCS017(SMU遥测采集和热控模块主份加电) 1
基于灵活与安全的考虑,在自主处置使能情况下,系统可自主处置(初始状态将自主处置标志设置为禁止);而在自主处置禁止情况下,也可依赖地面处置。

2.2 单机级故障诊断与过程恢复方法

深空星载计算机采用分布式的体系结构,其特点之一是物理级联的单机组合。例如,功能相同的主备单机(称为“上级单机”),物理连接到多个互相独立的单机(称为“下级单机”),或者为下级单机正常工作提供必要的物理条件,或者传递下级的信息。单机组合异常检测的原则包括以下4点:
(1)上级单机应作为独立单机纳入健康管理;
(2)上级单机判断应快于下级单机,以避免上级异常造成下级误判;
(3)上级单机异常可利用多个下级是否同时异常来判断;
(4)下级单机的判断过程不需考虑上级单机的异常,以避免交叉耦合,降低复杂度。
以1553B总线作为物理级联的分布式体系结构为例(见图1),远置RT是数管分系统和用户分系统间的接口,用以完成遥测数据采集、间接开关指令、串行加载指令以及数据的分配。各类远端均连接到BC上,仅当其地址和发自SMU命令中所指定的地址相符时,才会对SMU做出响应,属于下级单机。BC作为连接SMU与各类RT的唯一通道,其运行由SMU控制,属于上级单机。
基于单机组合异常检测的原则,上级单机SMU在基于测点设计的模块级故障诊断过程中,已作为独立单机纳入健康管理。对上级单机SMU与下级单机各RT开展故障诊断:
(1)上级单机SMU的异常通过多个下级RT是否同时异常进行判断。
(2)下级单机RT的故障不需考虑上级单机SMU的异常,避免交叉耦合,降低复杂度。
(3)上级单机SMU的故障判断时间为15 s,快于下级单机RT的30 s的判断时间,避免因上级异常造成下级误判。
(4)利用单机复位或冗余切换的功能实现过程恢复。具体策略如表4所示。该方法在深空星载计算机分布式的体系结构中得到广泛应用。
表 4 单机故障诊断与恢复策略

Table 4 Device fault diagnosis and recovery strategies

序号 名称 故障判断 功能
分解
恢复处理 说明
1 上级单机SMU故障 在功能使能时,连续15 s所有RT终端的AB总线均不通 SMU应用软件
进行判断
SMU软件自主切机使能情况下,实施中央处理模块自主切换;若自主切机不使
能则进行复位。功能执行一次后自主
禁止
该功能初始默认禁止,使能禁止状态可
通过指令修改且保存为重要数据
SMU记录事件报告
2 下级单机
远置RT
故障
在RT为主机加电状态,且功能使能情况下,SMU应用软件对RT遥测包的包序列计数进行
监视,若连续30 s未发生变化
SMU应用软件
进行判断
执行RT主断备开操作(指令间隔1 s),执行完操作自动禁止该功能
该功能初始默认禁止,使能禁止状态可通过指令修改且保存为重要数据
SMU记录事件报告
SMU 1553总线通信故障已由第1条排除,因此此时为RT1553总线通信故障

2.3 系统级故障诊断与过程恢复方法

基于深空星载计算机分布式的体系结构,SMU使用远置单元采集卫星硬通道遥测参数,通过1553B总线采集分系统软通道遥测参数,同时收集各分系统健康状态数据包。上述数据被用作故障诊断的输入。系统级故障诊断与恢复模块负责实现故障诊断及整器功能的恢复,如图6所示。
图 6 系统级故障诊断与恢复流程

Fig.6 System-level fault diagnosis and recovery process

2.3.1 系统级联的故障诊断与处置策略

作为系统级故障诊断的核心,SMU关注的是系统级的故障诊断策略,如图7所示。该策略需要多个分系统协同实现故障诊断模型,具体包括推进故障管理、控制故障管理、载荷故障管理、热控故障管理、测控故障管理、电源故障管理等。基于热控、测控、能源等相关的平台分系统快速重构保安全的原则,以及载荷分系统快速隔离保安全的原则,实现整器处置策略。
图 7 系统级故障诊断策略实施

Fig.7 Implementation of system-level fault diagnosis strategy

2.3.2 系统级故障诊断与恢复实例

以测控故障管理(长期无上行测控链路自主重建功能)为例进行详细说明,深空星载计算机系统是如何以数管分系统为核心,联合测控分系统、控制分系统协同实现长期无上行故障诊断并恢复整器上行遥控功能。由图8可知,数管分系统SMU是故障诊断与恢复的核心,负责故障的诊断与恢复的决策;控制分系统响应数管决策,完成整器姿态调整,协同处置故障;测控分系统响应数管决策,完成单机的故障恢复与重构[16]。故障诊断与恢复策略如下:
图 8 系统故障联合处置流程

Fig.8 Joint handling process of system-level faults

(1)SMU软件通过监视地面遥控注入引起的遥控传送帧计数变化,识别遥控注入事件。
(2)在SMU软件运行过程中,持续根据地面上行遥控注入事件维护最近一次接收到遥控指令的时间(CQ_LAST_INPUT)。当本功能从禁止变为使能时,默认将控制标识设为监视态。
(3)在监视态,若探测器在CQ_T1(相对于CQ_LAST_INPUT)内未收到上行遥控注入,软件进入干预态(第1步),发送自主处置序列1,对应答机实施复位操作。否则,维持监视态并持续监测长期无上行故障。
(4)在干预态(第1步),探测器等待地面上行恢复,若在CQ_T2(相对于进入到干预态(第1步)的时刻)内收到地面遥控注入,则禁止并退出本自主安全管理功能;若在CQ_T2内地面上行仍未恢复,软件进入干预态(第2步),发送自主处置序列2,对应答机实施断电操作;
(5)在干预态(第2步),判断是否进入干预态(第3步)。若进入,则发送自主处置序列3,通知控制分系统转对日定向,并按照对日定向姿态设置测控通道。依次进行判断,完成自主序列第4步、第5步的判断与执行,直到禁止并退出本功能。

3 结 语

鉴于深空星载计算机系统采用集中与分布式相结合的体系结构,本文引入模块级、单机级、系统级架构开展故障诊断与恢复研究。该方案不仅可以多维度地开展故障检测,降低漏诊和误诊的概率,还能通过多个分系统协同作用,实现系统级故障诊断与恢复,从而充分利用星上资源。此方法已在多个深空型号中得到应用,并达到了预期效果,为后续深空星载计算机系统的故障诊断与恢复奠定了坚实基础。
1
XIAO B, HU Q, FRISWELL M I. Active fault-tolerant attitude control for flexible spacecraft with loss of actuator effectiveness[J]. International Journal of Adaptive Control and Signal Processing, 2013, 27 (11): 925- 943.

DOI

2
WU Y, JIANG B, LU N. A descriptor system approach for estimation of incipient faults with application to high-speed railway traction devices[J]. IEEE Transactions on Systems, Man, and Cybernetics: Systems, 2017, 49 (10): 2108- 2118.

3
FU F Z, WANG D Y, LI W B. Research on multiple fault diagnosis method based on Kalman filter bank[J]. Control Theory&Applications, 2017, 34 (5): 586- 593.

4
FONOD R, HENRY D, BORNSCHLEGL E, et al. Thruster fault detection, isolation and accommodation for an autonomous spacecraft[J]. IFAC Proceedings Volumes, 2014, 47 (3): 10543- 10548.

DOI

5
CODETTA-RAITERI D, PORTINALE L. Dynamic Bayesian networks for fault detection, identification, and recovery in autonomous spacecraft[J]. IEEE Transactions on Systems, Man, and Cybernetics: Systems, 2015, 45 (1): 13- 24.

6
何熊文, 李楠, 徐勇, 等. 智能化航天器综合电子系统需求分析及其体系架构探讨[J]. 航天器工程, 2018, 27 (4): 82- 89.

HE X W, LI N, XU Y, et al. Requirements analysis of intelligent spacecraft avionics system and discussion of its architecture[J]. Spacecraft Engineering, 2018, 27 (4): 82- 89.

7
陈若玉, 毕国椬, 黄永葵, 唐三英. 数字式时分制指令/响应型多路传输数据总线. GJB 289A-97[S].

8
赵和平, 何熊文, 刘崇华, 强晖萍. 空间数据系统[M]. 北京理工大学出版社, 2018.

9
梁彧. 机械设备的故障诊断与检测研究综述[J]. 科技与创新, 2021, 61 (1): 153- 154.

LIANG Y. A Review of research on fault diagnosis and detection of mechanical equipment[J]. Technology and Innovation, 2021, 61 (1): 153- 154.

10
IFAC. SPafeProcessEvent: SPAFEPROCESS Technical committee guidelines on fault detection and isolation[R]. IFAC. (2023).

11
张伟, 李明. 航天器故障诊断技术综述[J]. 航天器工程, 2022, 31 (4): 12- 20.

ZHANG W, LI M. A Review of spacecraft fault diagnosis techniques[J]. Spacecraft Engineering, 2022, 31 (4): 12- 20.

12
王少萌. 基于KNN算法的模拟电路测点优化方法研究[D]. 北京: 北方工业大学, 2023.

WANG S M. Research on measurement point optimization for analog circuits based on KNN algorithm[D]. Beijing: North China University of Technology, 2023.

13
KOMBAYA TOUCKIA J, HAMANI N, KERMAD L. Digital twin framework for reconfigurable manufacturing systems (RMSs): design and simulation[J]. The International Journal of Advanced Manufacturing Technology, 2022, 120 (7): 5431- 5450.

14
AVIZIENIS A, LAPRIE J C, RANDELL B, et al. Basic concepts and taxonomy of dependable and secure computing[J]. IEEE Transactions on Dependable and Secure Computing, 2004, 1 (1): 11- 33.

DOI

15
沈毅, 李利亮, 王振华. 航天器故障诊断与容错控制技术研究综述[J]. 宇航学报, 2020, 41 (6): 647- 656.

SHEN Y, LI L L, WANG Z H. A Review of fault diagnosis and fault-tolerant control techniques for spacecraft[J]. Journal of Astronautics, 2020, 41 (6): 647- 656.

16
王大轶, 孟林智, 叶培建, 等. 深空探测器的自主运行技术研究[J]. 航天器工程, 2018, 27 (6): 1- 10.

WANG D Y, MENG L Z, YE P J. Research of autonomous operation technology for deep space probe[J]. Spacecraft Engineering, 2018, 27 (6): 1- 10.

Outlines

/