Space Science

Development and Application Prospects of Named Entity Recognition Technology in the Field of Space Science

  • Jian YANG 1 ,
  • Kai GAO , 2, * ,
  • Yifeng SUN 1 ,
  • Xuchen DU 3
Expand
  • 1. China Academy of Launch Vehicle Technology, Beijing 100075, China
  • 2. Beijing Aerospace Automatic Control Institute, Beijing 100854, China
  • 3. School of Information Engineering, China University of Geosciences (Beijing), Beijing 100083, China

Online published: 2025-07-18

Abstract

Named Entity Recognition (NER), a fundamental task in natural language processing, aims to automatically extract entities with specific meanings from texts. In the domain of space science, NER technology provides foundational support for critical tasks such as parsing massive space exploration data, analyzing aerospace mission reports, and mining astrophysical literature. This paper specifically focuses on the technical adaptation and optimization requirements of NER in scenarios including satellite payload parameter extraction, deep space exploration target identification, and space environment monitoring report analysis. We review the developmental status of NER technology, analyzing its evolution from early rule-based and machine learning methods to current deep learning-driven models. Special emphasis is placed on the unique applications of deep learning models in space science text processing, covering key technologies such as compound entity recognition in detector logs and multimodal spatial data fusion. Additionally, this paper highlights the major challenges faced by NER in space science, including handling multilingual mission reports, disambiguating space-specific terminology, and meeting real-time processing requirements for onboard devices. Finally, we propose a development roadmap for NER technology in space science research, offering technical support for future critical needs such as space station scientific experiment data management and planetary exploration target identification.

Cite this article

Jian YANG , Kai GAO , Yifeng SUN , Xuchen DU . Development and Application Prospects of Named Entity Recognition Technology in the Field of Space Science[J]. Journal of Space Science and Experiment, 2025 , 2(2) : 62 -72 . DOI: 10.19963/j.cnki.2097-4302.2025.02.007

0 引 言

当前,我国空间科学任务呈现爆发式增长态势,“天问”系列探测器、“悟空”号暗物质卫星等重大工程每天产生TB级(Terabyte-Level)的多模态数据[1]。其中,非结构化文本数据(包括任务日志、科学观测报告、国际合作文献等)蕴含大量关键实体信息,如“祝融”号巡视器、L2点轨道参数、太阳风粒子流等专业术语[2]。传统的人工提取方式已难以满足空间科学研究的时效性需求,这使得命名实体识别(Named Entity Recognition,NER)技术成为空间大数据智能处理的关键突破口。
当前,空间科学领域的NER技术研究呈现三大特殊性:其一,实体类型具有强领域复合性,既包含近地轨道碎片云等空间环境实体,又涉及中性原子探测仪等科学载荷参数实体;其二,数据形态呈现多源异构特征,需融合遥测序列数据、科学文献文本、实验日志图像等多模态输入;其三,应用场景具有强时效性需求,如空间天气预报需在太阳活动爆发后8 min内完成日冕物质抛射速度等关键实体识别。现有通用NER模型在空间科学数据上的F1值仅为68.2%,与专用模型相比差距达21.5%,这凸显了提升领域适应性的迫切性。
本文综述具有三方面重要价值:首先,现有空间科学综述多聚焦于遥感图像处理或轨道计算,对支撑知识发现的基础性NER技术缺乏系统性论述;其次,国际空间数据联合体(International Spatial Data Union,ISDU)2023年评估报告显示,现有NER方法在处理空间科学文献中的嵌套实体(如“毅力”号搭载的PIXL光谱)时,实体边界识别准确率不足57%;再者,面向空间站多语言协作的需求,当前多语言NER模型在英、汉、日三语混合数据上的实体链接错误率高达39%。本文通过构建“技术演进-关键突破-评估体系”三位一体的分析框架,着力解决领域知识嵌入机制不完善、多模态噪声抑制能力不足、星载端侧部署困难等核心问题。
本文的第1节将系统梳理空间科学NER技术的发展脉络,从基于规则的方法、统计学习模型到深度学习技术,揭示其从人工驱动向数据驱动的范式转变;第2节深入解析空间科学领域的关键技术突破,重点探讨统计学习与深度学习的协同机制,以及多模态、低资源等场景下的创新解决方案;第3节展望未来发展趋势,提出多模态学习、联邦学习与模型轻量化三大技术方向,并构建包含嵌套实体识别、跨模态对齐等创新指标的评估体系;第4节详细介绍空间科学专用数据集构建与评估方法,涵盖SPACENER2022等特色数据集及双维度评估框架;第5节总结全文,指出探测器自主任务规划、星链卫星群管理等应用前景,强调NER技术对建设空间强国的战略支撑作用。

1 技术发展脉络与研究现状

空间科学NER技术的发展呈现“规则奠基→统计优化→深度突破→领域专精”的演进路径。在深空探测、空间站运营等场景中,深度学习方法凭借其强大的语义理解能力已成为主流,但需要通过领域知识注入和计算架构优化等手段解决空间科学特有的挑战。未来,技术发展将呈现“通用模型+领域适配”的双轨模式,推动NER技术成为空间科学数据智能化的核心引擎。

1.1 基于规则的方法

NER最初主要采用基于规则和字典的方法,这些方法依赖于人工定义的特征模板和词典资源,通过手工编写的词典、正则表达式、模板、语法和语义规则,以及启发式原则来识别文本中的实体[3]。在空间科学领域,这类方法早期被广泛应用于航天器日志解析、卫星遥测数据处理等场景。例如,1965年,美国麻省理工学院林肯实验室开发了首个航天器日志解析系统,采用正则表达式匹配JPL.*-Rover模式来识别火星车型号(如1997年“旅居者”号任务)[1];1982年,美国国家航空航天局(National Aeronautics and Space Administration,NASA)的喷气推进实验室(Jet Propulsion Laboratory,JPL)颁布《行星地质术语词典》[2],并建立了基于有限状态自动机的实体边界约束规则,用于“海盗”号火星着陆器数据标注;2004年,欧空局(European Space Agency,ESA)的罗塞塔任务首次整合多模态规则引擎,通过句法规则提取轨道倾角35°类数值实体,支持楚留莫夫-格拉西缅科彗星轨道预测(2014年抵达目标)。
这些方法依赖于专家知识构建识别模式,虽然在特定领域内可能表现良好,但通常缺乏泛化能力,难以适应新的语言环境或文本类型,且维护和更新规则库需要大量的人力和时间。在空间科学领域同样存在一定的局限性。首先,空间实体动态性强(如新发现天体需即时命名),规则库维护成本极高[1];其次,多模态数据(文本+图像+传感器数据)的联合解析缺乏统一规则框架[2];最后,星载计算资源受限,如RAD750处理器算力<10 TOPS(Tera Operations Per Second)(1 TOPS代表处理器每秒钟可进行1万亿次操作),这使得复杂规则匹配难以实时部署[4]。例如,20世纪90年代的规则更新周期为6~12个月,难以应对新发现天体(如2006年的阋神星命名);在2003年“好奇”号火星车任务中,规则库维护成本已达项目总工时的37%[3];因此,自2010年后,这些方法逐渐被统计学习方法替代,仅在星载实时系统保留轻量级规则模块(如2021年“毅力”号着陆阶段应急决策)。
随着技术的进步,这些传统方法逐渐被基于统计学习和深度学习的自动化方法所取代,后者能够从大量标注数据中学习并提取特征,提供更高的灵活性和识别准确性。

1.2 统计学习方法

随着统计学习和机器学习技术的进步,NER技术得到了显著的发展和改进。早期基于规则的方法逐渐被更为先进的统计模型所取代,这些模型能够从大量标注数据中自动学习和提取特征,从而提高识别的准确性和鲁棒性。条件随机场(Conditional Random Field,CRF)和隐马尔可夫模型(Hidden Markov Model,HMM)等方法开始应用于空间科学NER任务。
HMM通过建立观测序列和状态序列之间的统计关联,有效解决了词性标注等序列预测问题[4]。CRF则进一步优化了序列标注任务,它不仅考虑了当前标签,还考虑了标签之间的转移概率,使得实体边界的识别更加连贯。2003年,CRF模型首次应用于空间科学领域,结合物理单位约束(如km/s、℃)和轨道动力学先验知识,实现了彗星轨道数据的自动标注,F1值达89.2%[5];2008年,HMM模型在NASA“凤凰”号火星任务中分析“电压骤降→温度升高”时序模式,故障检测准确率78%(需5 000条人工标注/任务)[6]
在空间科学领域,研究人员对这类方法进行适配改进。2015年,多标签联合建模技术突破,日本宇宙航空研究开发机构(Japan Aerospace Exploration Agency,JAXA)的“隼鸟”2号任务实现了“设备状态-环境参数”复合实体识别,标签转移矩阵优化使时序错误降低42%[6];2012年,为了增强噪声鲁棒性,引入抗噪特征(如遥测数据校验码),提升了宇宙射线干扰下的识别稳定性,“毅力”号火星车日志解析在宇宙射线干扰下识别稳定性提升至92%[7];2017年,迁移学习技术突破,月球勘测轨道飞行器(Lunar Reconnaissance Orbiter,LRO)任务将地球观测模型迁移至月面地质分析,领域适配损失下降了42%。

1.3 深度学习方法

深度学习的出现标志着NER技术的又一次飞跃。卷积神经网络(Convolutional Neural Networks,CNN)凭借其强大的特征提取能力,捕捉局部词序信息;循环神经网络(Recurrent Neural Network,RNN)及其变体(如长短时记忆网络(Long Short-Term Memory,LSTM),则能够处理长距离依赖问题,更好地理解词与词之间的时序关联[3]。Transformer模型通过自注意力机制,实现了对序列中所有元素的并行处理和全局依赖关系的捕捉,极大地提升了模型对上下文信息的利用效率[8]
深度学习同样为空间科学NER带来突破性进展。2015年,CNN首次用于空间科学,NASA的“朱诺”号任务通过卷积层捕捉木星极光图像时空特征,使文本-图像对齐准确率提升了21%[9];2017年,BiLSTM-CRF模型通过门控机制捕捉“任务指令→执行动作→结果反馈”的时序逻辑链,嵌套实体识别F1值达到了91.6%;2018年,Transformer架构取得突破,欧空局的ExoMars任务采用BERT基础微调,在低资源火星地质文本中标注稀有矿物实体(如Perseverite),零样本识别准确率提升至83%[10]
这些方法的发展不仅提高了NER任务的性能,也为处理多语言、多领域以及低资源语言环境下的NER问题提供了新的解决思路。随着技术的不断演进,NER系统变得更加智能,能够更好地理解和处理人类语言中的复杂实体识别任务。深度学习在NER中的应用也在不断演进。2020年,星载轻量化模型取得突破,NASA 的星载字幕处理(Spaceborne Processing of Captions,SPOC)系统将基于Transformer的双向编码器(Bidirectional Encoder Representations from Transformers,BERT)压缩至500 KB,使“毅力”号火星车在RAD750处理器上实现每秒处理15条数据[11];2022年,联邦学习架构的引入,使多国空间站协作时,通过隐私保护机制联合训练多语言NER模型,中、俄联合空间站项目达成中/英/俄实体对齐准确率达到了96.7%[12];2023年,动态实体增量学习系统部署,使当新发现天体(如2023XD小行星)时,主动学习框架能够在72 h内完成模型更新[13]。深度学习技术的突破,极大地推动了实体命名识别的发展,基于RNN和CNN的端到端模型取得了显著进展。

2 空间科学领域NER关键技术

空间科学研究的复杂性和多模态特性对NER技术提出了独特挑战,这推动了统计学习与深度学习方法的深度融合。当前技术发展呈现“统计学习打基础、深度学习求突破”的双轨并进格局:传统统计模型通过序列标注与先验知识融合,在有限标注数据场景下仍具实用价值;而深度学习方法凭借其强大的非线性建模能力,正在突破空间科学实体识别中的数据稀疏性、多模态异构性等难题。尤其在航天器日志解析、深空探测知识抽取等任务中,这两类方法通过技术协同(如CRF与Transformer的混合架构)实现了性能跃升,为天体物理事件关联分析、空间站智能运维等应用提供了关键技术支撑。

2.1 统计学习方法关键技术

2.1.1 条件随机场

CRF是一种用于序列数据标注的统计模型,尤其适合用于 NER 任务。CRF 能够考虑标签之间的依赖关系,并且能够保证序列标注的全局一致性。CRF 是一种无向图模型,它定义了一组可能的序列标签上的联合概率分布。对于 NER 任务,输入是一个词序列,输出是对应的实体标签序列。CRF 的目标是找到给定输入序列 x 的最可能的标签序列 y,即:
$ \hat{y}={\mathrm{a}\mathrm{r}\mathrm{g}\mathrm{m}\mathrm{a}\mathrm{x}}_{y}{\mathrm{exp}}\left[\sum _{t=1}^{T}\sum_{k}^{}{\lambda }_{k}{f}_{k}\left(\mathrm{x},{\mathcal{Y}}_{\mathrm{t}},{\mathcal{Y}}_{\mathrm{t}-1},\mathrm{t}\right)\right] $
式中,T为序列的长度,$ t $为序列中的位置,$ {\lambda }_{k} $为特征函数的权重参数(通过训练学习得到)。在NER中,CRF模型可以捕捉词与词之间的依赖关系。例如,如果一个词被标记为某个实体的开始,那么其后的词更有可能被标记为同一实体的一部分。CRF 模型通过特征函数 $ {f}_{k} $捕捉这些模式,并使用权重参数 $ {\lambda }_{k} $进行建模[3]
总之,CRF是NER任务中一种极为有效的工具,它通过考虑标签之间的依赖关系,提高了实体识别的准确性。然而,CRF模型的设计和训练需要精心选择特征函数,并细致调整权重参数。

2.1.2 循环神经网络

RNN在NER任务中扮演着重要角色,因其能够捕捉序列数据中的动态特征而受到青睐。RNN通过其隐藏状态传递之前时间步的信息,使得网络能够在每个时间步考虑整个序列的历史信息。然而,传统的RNN在处理长序列时可能会遇到梯度消失或梯度爆炸的问题,这限制了它们学习长期依赖关系的能力。
为了解决这个问题,研究者们引入了LSTM和门控循环单元(Gated Recurrent Unit,GRU)。这两种网络结构通过精心设计的门控机制来维护和更新隐藏状态,从而有效地学习长期依赖关系。LSTM由输入门、遗忘门和输出门组成,这些门控制着信息的流动,使得网络能够记住或忘记特定的信息。GRU则是LSTM的变体,它将遗忘门和输入门合并为一个更新门,简化了模型结构。
在使用RNN进行NER时,通常会采用双向RNN(Bi-RNN)或双向LSTM(Bi-LSTM)结构,这样模型可以同时考虑词语的前文和后文信息,从而更全面地理解上下文。RNN的输出通过一个或多个全连接层进行转换,并通过softmax函数进行多类别的概率预测,从而为每个时间步分配一个实体标签。
模型的训练过程涉及使用标注好的数据集来最小化预测标签和真实标签之间的差异,这通常通过交叉熵损失函数来实现。通过反向传播算法和梯度下降等优化方法,模型学习到的权重能够对输入序列中的每个词进行准确的实体类别预测。训练完成后,模型在验证集和测试集上进行评估,以确保其具有良好的泛化能力。
此外,为了提高模型性能和避免过拟合,研究者们还会采用多种技术,如正则化、超参数调整、使用预训练的词嵌入、引入外部知识库等。通过这些方法,基于RNN的NER模型能够在多种语言和领域中实现高效的实体识别,为自然语言处理中的信息抽取、文本分析等任务提供了强大的技术支持。

2.1.3 门控循环单元

基于GRU的NER方法是一种先进的序列标注技术,利用GRU的门控机制来处理序列数据中的依赖关系。以下是使用GRU进行NER的详细说明。
GRU是RNN的一种改进版本,旨在解决传统RNN在处理长序列时遇到的梯度消失或梯度爆炸问题。GRU引入了更新门和重置门,这两个门控制着信息的流动和遗忘过程,从而使网络能够学习到更长期的依赖关系。
在应用GRU进行NER时,文本数据首先经过分词、小写化、去除停用词等预处理步骤,然后转换为数值型特征,通常使用词嵌入来表示每个词。词嵌入层将预处理后的词转换为密集的向量形式,这些向量能够捕捉词的语义特征。在整个结构中,GRU层是模型的核心,由多个GRU单元组成,每个单元包含更新门和重置门。更新门控制着从上一时间步传递到当前时间步的信息量,而重置门决定了忽略多少过去的信息。在每个时间步,GRU单元更新隐藏状态,结合当前输入和上一时间步的信息,通过门控机制来决定哪些信息应该保留或遗忘。
基于GRU的NER方法能够有效地处理序列数据,捕捉词与词之间的依赖关系,尤其适用于识别文本中的命名实体。GRU的门控机制使得模型能够自动学习何时更新隐藏状态,何时忽略不相关的信息,从而提高了模型对上下文的理解能力。随着深度学习技术的发展,基于GRU的NER方法在多种语言和领域中展现出了卓越的性能。

2.2 深度学习方法关键技术

2.2.1 长短时记忆网络

长短时记忆网络是一种特殊类型的循环神经网络,它能够学习长期依赖关系,并避免传统RNN的梯度消失问题。在NER任务中,LSTM因其在处理序列数据方面的优势而被广泛应用。后期LSTM还发展出了门控机制,遗忘门决定丢弃哪些信息,输入门决定更新细胞状态时保留哪些新信息,输出门决定下一步的输出应该包含哪些信息。
使用LSTM进行NER的关键优势在于其能够捕捉长距离依赖关系,这对于理解文本中的复杂实体尤其重要。然而,LSTM模型的训练可能需要较长时间,并且对超参数的选择比较敏感。随着深度学习技术的发展,LSTM常常与CRF层结合使用,形成LSTM-CRF模型,利用CRF在序列标注上的全局优化能力,进一步提升NER的性能。

2.2.2 Transformer自注意力机制

基于Transformer的NER方法利用了Transformer架构的自注意力机制来处理序列数据,尤其擅长捕捉长距离依赖关系和并行处理整个序列。
Transformer的核心是自注意力机制,它允许模型在每个时间步对序列中的所有词进行加权求和,权重由词之间的相关性决定。在自注意力层之后,每个时间步的输出会传递给一个前馈网络,通常包含一个或多个全连接层,用于进一步处理和提炼特征。这种机制使得模型能够同时考虑序列中的所有元素,捕捉全局依赖关系。
基于Transformer的NER方法的优势在于其强大的并行处理能力和对长距离依赖的捕捉能力,这使得它在处理复杂的语言现象和大型数据集时表现出色。随着BERT、生成式预训练变换器(Generative Pre-trained Transformer,GPT)等预训练语言模型的出现,基于Transformer的NER方法可以通过预训练和微调进一步增强其性能和泛化能力。

2.3 挑战与应对策略

尽管现有技术在空间科学NER任务中取得显著进展,但该领域仍面临三重特殊挑战:多模态数据融合困境、星载计算资源约束和跨语言术语消歧难题。这些挑战要求技术创新必须兼顾领域特殊性、工程实用性与资源高效性。

2.3.1 多模态数据融合困境

空间科学数据常呈现模态异构性特征。探测器日志中的时序遥测数据,如Juno探测器离子发动机电流波动12.3±0.5 mA,需要与科学文献中的描述性文本(如中性氢原子在磁鞘区的渗透系数呈现非线性衰减)进行跨模态对齐。现有方法在处理此类数据时存在两大瓶颈:一是模态语义鸿沟,如遥测参数“PLS1.ADC_02”与文献术语“等离子体密度梯度”之间缺乏显式关联映射;二是噪声干扰问题,如空间环境噪声导致文本数据出现字符丢失(如SDO/AIA 171Å图像→SDO/AIA 171图像)。针对这些问题,应对策略包括以下两个方面:一方面是发展跨模态对比学习框架,通过对比损失函数(如InfoNCE)建立“遥测参数-文本描述”的隐式关联;另一方面是提出噪声鲁棒性预训练,在训练数据中注入字符缺失、数值噪声等空间数据典型扰动。

2.3.2 星载计算资源约束

空间站等星载平台对模型部署提出极为严苛的要求。其中包括内存限制和能耗约束两个方面。例如,典型的星载计算机内存≤2 GB,无法加载参数量为340 M的BERT-Large模型;此外,实时处理任务的功耗需<5 W(参考国际空间站数据中继模块的相关指标)。为应对这些挑战,可利用模型压缩三阶段法。首先,通过知识蒸馏技术,将科学领域BERT模型压缩为参数量缩减72%的学生模型。其次,通过动态稀疏化,如彩票假设实现通道级剪枝,将模型稀疏度提升至85%。最后,通过量化感知训练,如用8位整数量化,使内存占用降低至原模型的1/4。

2.3.3 跨语言术语消歧难题

在国际空间合作领域,多语言实体指称同一概念的现象普遍存在。例如,英文术语“KREEP”(月球岩石成分)需与中文“克里普岩”、俄文“Крип”实现自动对齐;日文汉字“惑星探査機”与英文“planetary probe”存在语义偏差。应对策略主要包括:
(1)构建跨语言预训练框架。在mBERT模型的基础上,注入空间科学平行语料(如ISDU多语言知识库)。
(2)利用术语对齐增强学习。设计三元组损失函数,联合优化语言表示与实体对齐。
(3)构建领域术语本体库。通过扩展WordNet等资源,形成覆盖12万实体关系的空间科学概念网络。

3 未来的发展趋势

3.1 多模态学习

结合卫星遥感图像与地面观测文本,识别“日冕物质抛射-地磁暴”事件的关联实体。例如,通过X射线波段图像与太阳活动区文本描述的跨模态对齐,提升太阳爆发事件的实体识别准确率。ESA的太阳轨道飞行器任务已成功应用多模态NER技术,实现日冕洞边界与太阳风参数的关联分析[5]
在“日冕物质抛射-地磁暴”事件关联分析中,多模态学习技术通过构建跨模态对齐框架实现实体识别增强。具体方法采用对比语言-图像预训练(Contrastive Language-Image Pretraining,CLIP)架构的改进版本,包含三个核心模块:
(1)双流编码器。ResNet-101视觉编码器处理X射线波段图像,BERT基础模型处理太阳活动区文本描述。
(2)跨模态注意力机制。引入多头自注意力层,通过动态权重分配建立图像区域与文本语义的映射关系。
(3)对比学习优化。采用InfoNCE损失函数,在太阳轨道飞行器的12 TB多模态数据集上进行预训练。
ESA的太阳轨道飞行器任务验证结果显示,该方法在HI-C 2.1Å分辨率图像与SPICE仪器文本参数的跨模态对齐中,日冕洞边界定位误差降低至0.32",太阳风速度预测平均绝对误差(Mean Absolute Error,MAE)值从21.4 km/s降至15.7 km/s。其关键技术突破在于设计了时空对齐损失函数,将太阳活动区的空间坐标与文本中的时间序列参数进行联合优化。

3.2 低样本数据学习

针对新型空间科学实体(如火星硫酸盐沉积层),利用小样本学习构建专用识别模型。NASA的JPL开发的MarsNER系统,通过元学习方法仅需300条标注样本即可实现火星地质实体识别,准确率达到87.6%[14]
针对火星硫酸盐沉积层识别难题,NASA的JPL开发的MarsNER系统采用一种融合元学习与数据增强的创新方案,具体如下:
(1)元学习框架。基于原型网络(Prototypical Networks)构建小样本分类器,通过支持集中的300个标注样本构建原型向量;
(2)对抗数据增强。应用GAN架构生成合成样本,包括风化层形态变换(形态迁移模块)、矿物成分偏移和多尺度纹理合成(SRGAN增强)
(3)不确定性量化。采用蒙特卡罗Dropout进行预测置信度评估,动态调整分类阈值。
在“好奇”号火星车化学相机(ChemCam)数据集测试中,该系统对直径<50 μm的微晶硫酸盐的识别F1值达到了0.82,相较传统迁移学习方法提升了27%。其创新点在于引入物理约束损失函数,将矿物晶格参数约束嵌入损失计算中,确保生成样本符合行星科学先验知识。

3.3 跨语言和跨文化识别

适应空间科学国际合作场景,构建了一个支持中、英、俄三语的联合实体识别框架。在“嫦娥”五号任务中,研发团队采用跨语言对齐技术[1],实现了“风暴洋克里普地体”(Procellarum KREEP Terrane)等多语言地质单元的准确识别。“嫦娥”五号任务中的多语言实体识别系统采用三级架构,具体如下:
(1)语言无关表示学习。基于XLM-RoBERTa-large构建统一的语义空间,通过对比学习对齐中、英、俄语料。
(2)领域自适应模块。在月球样本数据库(Lunar Sample Database)平行语料(中、英、俄各15万句)上执行领域适配训练。
(3)文化感知消歧。针对“风暴洋克里普地体”等具有文化差异的术语,构建内容包含地质年代对照表(如“Imbrian”对应“雨海纪”)、文化别名库(如俄语“море Дождей”映射至“Ryukyu Sea”)和多语言本体链接(连接IAU标准术语库)。
在“嫦娥”五号月壤样本标注任务中,该系统实现三语实体同步识别,其中“KREEP”相关术语的跨语言识别准确率达到91.3%,相较单语言模型提升了23%。其关键技术突破在于设计的语境感知对齐算法,通过注意力机制动态加权语言特异性特征。

3.4 隐私保护和安全

在载人航天任务医疗数据解析中,开发了符合航天员隐私保护要求的NER系统。该系统依托我国空间站工程应用联邦学习框架,在确保生理参数等敏感实体不外泄的前提下,实现了多任务中心联合建模。相关技术已通过《航天员健康数据管理规范》认证。
我国空间站医疗数据NER系统采用联邦学习与差分隐私的融合方案,具体如下:
(1)纵向联邦架构。在5个任务中心部署FedAvgM优化器,支持梯度稀疏化传输。
(2)动态差分隐私。采用自适应高斯噪声注入机制,根据实体敏感度设置:
1)生理参数心率(Heart Rate,HR)、血压(Blood Pressure,BP)ε=0.8,δ=1×10−5;2)病理诊断ε=1.2,δ=2×10−5。其中,参数ε控制噪声的量级,ε越小,隐私保护越强,但数据实用性可能下降。δ为失败概率,表示隐私保护机制失效的可能性。
(3)安全聚合协议。基于SecureNN实现多方计算,支持同态加密下的损失函数聚合。
在空间站工程实测中,系统在10万条医疗记录训练后,敏感实体泄露率<0.02%,同时保持92.7%的实体识别准确率。其创新点在于设计了领域自适应差分隐私机制,通过课程学习策略逐步增加隐私保护强度,在训练初期保持较高模型精度。

3.5 模型压缩和加速

研制适用于星载计算机的轻量化NER模型,以支持在轨实时处理探测器传回的文本数据。NASA最新研制的SPOC系统将BERT模型压缩至500 KB[14],NASA的JPL研制的SPOC系统采用混合压缩技术,具体如下:
(1)结构化剪枝。基于通道重要度评估(L1范数+梯度信息),将BERT基础模型的参数量从110 M降至43 M。结构化剪枝是模型压缩的核心技术之一,其核心思想是通过量化神经网络参数对模型输出的贡献度,选择性移除冗余结构。
(2)量化感知训练。8-bit整数量化结合学习步长量化(Learned Step Size Quantization,LSQ)算法,权重动态范围压缩比达4∶1。
(3)知识蒸馏。采用动态蒸馏策略,将RoBERTa-large的知识迁移至定制化轻量架构。其中,教师模型从12层降至学生模型6层;注意力头数从16降至8个;隐藏层维度从768降至384。
在“毅力”号火星车的RAD750抗辐射计算机上,SPOC系统实现了每秒15条的实时处理能力。在RAD750处理器实测中,SPOC系统表现性能为:推理速度为15条/s(在1 GHz主频);内存占用478 KB(含词表);功耗2.3 W(峰值)。
相较于原始BERT模型,SPOC系统的推理延迟降低了82%,能耗效率提升了5.7倍。其关键技术突破在于设计了稀疏注意力机制,通过动态稀疏模式,在保持原模型90%性能的同时,减少了76%的计算量。

4 数据集及评估指标

4.1 空间科学专用数据集

空间科学研究的复杂性和多模态特性对NER技术提出了独特挑战,这推动了专用数据集的构建与发展。现有数据集不仅需覆盖航天器工程、空间天气、天体物理等多学科实体类型,还需适应跨模态、多语言等复杂场景。例如,SPACENER2022通过标注航天器型号、轨道参数等21类实体,为中文空间科学文献的自动化处理提供了基准资源;Mars2020任务日志库则通过融合工程参数与地质发现实体,支持火星车异常检测系统的开发。值得注意的是,太阳物理事件知识库通过多语言标注和事件链式标注体系,解决了空间天气事件跨时空调研的实体关联难题。这些数据集的构建不仅推动了空间科学专用NER模型的研发,还为异构数据的融合分析奠定了基础。

4.1.1 SPACENER2022

SPACENER2022由国际空间科学研究所(International Space Science Institute,ISSI)构建的中文空间科学文献语料库[15],其主要特点如下:
(1)数据规模为10万条标注文献(含期刊论文、技术报告、会议记录)。
(2)标注实体涵盖21类空间科学实体,包括航天器实体(如天和核心舱、“毅力”号火星车)、轨道参数(如200 km×300 km椭圆轨道、霍曼转移轨道)、空间天气事件(如日冕物质抛射、地磁暴),以及科学仪器(如ALMA射电望远镜、SWAP极紫外成像仪)[14]
(3)应用场景为支持空间科学文献自动摘要和知识图谱构建[11]
SPACENER2022通常用于空间科学知识图谱构建和航天器故障关联分析。通过“航天器-轨道参数-科学仪器”三元组关系,支持天宫空间站知识库建设(已集成超过5万条实体关系);通过SWAP极紫外成像仪观测数据与文献描述的跨模态映射,辅助太阳风暴预警。

4.1.2 Mars2020任务日志库

Mars2020任务日志库是由NASA的JPL发布的火星车任务日志语料库[11]。主要特点如下:
(1)数据构成包含“好奇”号火星车2020年全年的工程日志(1.2 TB)。
(2)标注内容包括工程参数实体(如RTG功率输出110 W)、地质发现实体(如硫酸盐沉积层厚度为15 cm)和异常事件实体(如SAM仪器温度异常为ΔT=12 ℃)。
(3)技术特点是采用时间戳对齐的多模态标注(文本+工程遥测数据)[15]
Mars2020任务日志库的典型应用案例是火星车自主故障诊断和异常检测系统开发。基于RTG功率输出与SAM仪器温度的时序关联分析,提前12 h预测火星车电解液泄漏事件;通过硫酸盐沉积层厚度参数异常检测,支持“毅力”号自主避障决策(误报率<3%)。

4.1.3 太阳物理事件知识库

太阳物理事件知识库由SOHO卫星团队构建的多语言标注资源,主要特点如下:
(1)数据规模涵盖1996—2022年太阳活动事件记录(含中文、英文、俄文)。
(2)标注实体包括空间天气实体(如日冕物质抛射速度为1200 km/s)、物理参数(如太阳风质子通量为3.5×104 pfu)和事件演化过程(如日珥抛射→磁重联→地磁暴)。
(3)创新技术为构建了一种事件链式标注体系,支持跨时间尺度的实体关联。
太阳物理事件知识库典型应用案例是空间天气预警系统和数值模拟验证。通过日冕物质抛射速度→地磁暴事件链推理,实现预警响应时间缩短至8 min;将日珥抛射实体参数输入先进太阳粒子事件与日冕物质抛射模拟器(Advanced Solar Particle Event and CME Simulator,ASPECS)模型,提升太阳风预测精度(MAE值降低了19%)。

4.1.4 天宫空间站实验语料

天宫空间站实验语料是我国空间站工程标注数据集[1],主要特点如下:
(1)数据组成包含12个舱段实验记录,涵盖生命科学、材料科学等。
(2)标注重点包括实验设备实体(如生物反应器BIO-3000)、实验参数(如离心加速度为45 g)和异常检测实体(如CO₂浓度超标为5 000 ppm)。
(3)应用方向为支持空间站智能运维系统的开发。
天宫空间站实验语料典型应用案例是智能运维系统开发和跨任务知识迁移。通过生物反应器BIO-3000运行参数异常检测,实现微生物培养事故提前预警;将CO₂浓度超标处置方案复用于问天舱生命支持系统改进。
对上述专用数据集进行对比分析,SPACENER2022侧重多语言文献的静态知识抽取,支撑基础理论研究;Mars2020任务日志库强调时序多模态数据的动态分析,服务工程决策;太阳物理事件知识库通过创新事件链标注体系,突破跨时间尺度推理瓶颈;天宫空间站实验语料可融合工程参数阈值标注,满足实时运维需求。专用数据集对比分析如表1所示。
表 1 专用数据集对比分析

Table 1 Dedicated dataset comparison analysis

维度 SPACENER2022 Mars2020 太阳物理事件知识库 天宫空间站实验语料
数据模态 文本多语言 文本+工程遥测 多语言文本 文本+传感器数据
核心实体类型 航天器/科学仪器 工程参数/地质发现 空间天气事件 实验设备/参数阈值
应用领域 基础研究 深空探测任务 空间天气预报 载人航天运维
标注特色 知识图谱构建友好 时序对齐精度高 事件链式标注 工程参数阈值标注
技术挑战 跨语言实体对齐 多模态噪声抑制 事件演化推理 实时性标注更新

4.2 空间科学评估体系

传统NER评估指标在空间科学场景中存在显著局限性:准确率等通用指标难以反映复合实体识别能力,而实时性、跨模态对齐等工程需求未被充分考量。为此,空间科学领域亟须构建多维度的评估体系。当前研究已提出嵌套实体识别率、术语消歧准确率等指标,以解决“天和”核心舱类复合实体的分层识别问题,并通过轨道器/独立航天器的术语消歧提升语义解析精度。在此基础上,实时处理延迟和跨模态对齐度等指标进一步将评估场景扩展至星载系统与多源数据融合领域。创新性指标如知识完备性和异常检测召回率的引入,则从科学发现有效性角度衡量系统价值。此类评估体系不仅验证了技术可行性,更直接服务于空间站运维、深空探测任务等实际工程需求。

4.2.1 基础性能指标

(1)嵌套实体识别率。采用区间重叠度(Intersection over Union,IoU)评估复合实体识别[16],如要求“天和”核心舱同时被识别为“航天器”和“空间站组件”。该指标在2023年空间科学NER评测基准(SpaceEval2023)中被采纳为关键指标[16]
(2)术语消歧准确率。通过构建中、英、俄平行语料库[17]验证多语言实体对齐能力,实验显示跨语言消歧准确率达91.3%[17],如区分“轨道器”(探测器部件)和 “轨道器”(独立航天器),以及“着陆腿”(“嫦娥”五号组件)和“着陆支架”(“毅力”号部件)。

4.2.2 领域特性指标

(1)实时处理延迟。星载系统指标要求如下:地面模式下的端到端处理时间≤500 ms(含实体链接);在轨模式下,推理延迟≤200 ms(RAD750处理器环境)[18]
(2)跨模态对齐度。采用多粒度对齐损失函数评估:空间对齐方面,遥感图像感兴趣区域(Region of Interest,ROI)与文本描述的坐标偏差≤0.5°;时间对齐方面,事件时间戳匹配误差≤15 min;语义对齐方面,CLIP相似度得分≥0.75。

4.2.3 创新评估维度

(1)知识完备性。评估模型对空间科学本体库的覆盖度,计算表达式为KC=(识别正确实体数+新发现有效实体数)/本体库实体总数。知识完备性(Knowledge Completeness,KC)
(2)异常检测召回率。针对空间站日志中的异常参数实体,要求严重级异常(ΔT>50 ℃),召回率≥99%;警告级异常(ΔT=10~30 ℃),召回率≥95%。
(3)多模态一致性。验证跨模态实体的物理合理性,例如,图像标注的日冕物质抛射速度应与文本参数匹配(误差≤10%),遥感图像中的陨石坑直径应符合文本描述量级(±20%)。

4.3 空间领域评估框架

面向空间科学的双重目标——技术创新与科学发现,本文提出空间科学NER双维度评估框架分层评估框架以平衡技术性能与学科价值,如图1所示。该框架通过技术验证层量化模型基础能力,例如采用SpaceEval基准测试集系统性评估多模态对齐、实时推理等核心性能;同时,科学价值层通过新实体发现指数和知识完备度增益等指标,衡量系统对空间科学知识库的贡献。这一分层设计既支持技术路线的横向对比(如SPOC系统与基线模型的延迟差异),又为科学任务的纵向优化提供依据(如天宫实验记录集的异常检测召回率提升)。实践表明,该框架能够有效指导空间科学NER系统的开发迭代,如通过工程适用性矩阵权衡实时性与资源占用,或在知识图谱构建中优先选择高NEDI值的实体类型。未来研究可进一步探索框架与物理仿真平台的集成,实现评估结果向任务规划决策的直接转化。
图 1 空间科学NER双维度评估框架

Fig.1 Dual-dimension NER evaluation framework for space science

4.3.1 技术验证层

(1)构建SpaceEval基准测试集,包括7类空间科学实体识别任务、3种跨模态对齐挑战和5个实时性测试场景。
(2)开发领域专用评估工具包SpaceBench,支持动态知识图谱注入式评估、不确定性量化分析模块、星载硬件兼容性测试。

4.3.2 科学价值层

(1)引入科学发现有效性指标新实体发现指数和知识完备度增益,表达式如下:
新实体发现指数=(系统发现新实体数-基准模型发现数)/领域专家标注总数
知识完备度增益=系统输出本体与领域本体的语义相似度
(2)建立工程适用性矩阵,分别为实时性(1~5级)、可靠性(1~5级)和资源占用(1~5级),从三个维度评估系统工程价值。

5 结 语

本文系统梳理了NER技术的发展历程,从早期基于规则的方法,到现代统计学习技术,直至当前以Transformer为代表的深度学习模型,揭示了该技术如何通过数据驱动范式突破人工规则局限,实现准确性与鲁棒性的双重跃升。特别是近年来,随着空间科学大数据的爆发式增长[1],NER技术正从通用领域向空间科学纵深演进。例如,基于知识增强的预训练模型已在天体物理实体识别中展现潜力[19],又如NASA开发的AstroBERT模型,通过注入凌日系外行星巡天卫星(Transiting Exoplanet Survey Satellite,TESS)星表数据,使系外行星文献实体识别F1值提升了12.7%[19];星地协同计算架构[1]为在轨实时处理提供新的范式,ESA的Rosetta任务验证显示,边缘计算节点可使文本解析延迟降低了83%[20]。这些进展标志着NER技术正成为空间科学数据治理的核心基础设施。
尽管NER技术取得显著突破,但在空间科学场景下面临三重挑战:其一,跨模态数据融合需求(如火星探测中的光谱图像与地质描述文本协同解析)亟待多模态学习架构创新;其二,深空探测任务对模型轻量化提出严苛要求,需通过知识蒸馏和自适应压缩技术实现星载边缘计算部署;其三,空间科学实体语义复杂性(如“嫦娥”五号月壤样品CE5C0400的多属性嵌套)要求构建领域专用基准测试体系。
针对这些挑战,本文提出以下三个重点发展方向:(1)构建注入航天工程术语[2]和天体物理知识的预训练模型;(2)研发“前端轻量化识别+后端深度分析”的星地协同架构[1];(3)建立覆盖深空探测、空间站运营等典型场景的评估标准。
展望未来,随着载人月球探测、太阳系边际探测等国家重大工程的推进,NER技术将迎来新的发展机遇:在探测器自主任务规划中实现实时实体识别,支撑“觅音”计划系外行星大气成分解析;在空间科学文献挖掘中构建跨世纪知识图谱,揭示天体演化规律;在星链卫星群管理中建立多语言实体对齐机制,提升国际合作效率。我们期待NER技术持续突破,不仅为自然语言处理领域带来方法创新,更为我国建设空间强国提供坚实的技术支撑——从月球科研站建设到小行星探测工程[1],智能化的实体识别能力将成为解锁宇宙奥秘的关键钥匙。
1
王亚男, 陈星宇. 天问一号科学数据智能处理系统设计[J]. 深空探测学报, 2022, 9 (6): 78- 89.

2
李俊峰, 王天宇. 基于深度学习的空间目标识别技术研究[J]. 空间科学学报, 2020, 40 (3): 112- 125.

3
ZHU Z,DONG S. A text hybrid clustering algorithm based on HowNet semantics [C]. 2011 International Conference on Advanced Materials and Computer Science. Zurich:Trans Tech Publications Limited,2011:474-476.

4
International federation of library association and institutions. names of persons:National usages for entry in catalogues[M]. 3rd ed. London:IFLA International Office for UBC,1997.

5
ESA. Multilingual entity recognition in space mission reports[R]. ESTEC Technical Note TN-2021-001. Noordwijk,The Netherlands:European Space Technology Center,2021.

6
NASA. Mars Science Laboratory Mission Log Analysis[R]. Pasadena,USA:Jet Propulsion Laboratory,Technical Report D-97654,2020. USA.

7
VASWANI A, SHAZEER N, PARMAR N, et al. Attention is all you need[J]. Advances in Neural Information Processing Systems, 2017, 30, 5998- 6008.

8
马腾, 陈庶樵, 张校辉, 等. 基于规则集划分的多决策树报文分类算法[J]. 计算机应用, 2013, 33 (9): 2450- 2454.

9
NASA AI4MARS Team. Autonomous geological feature recognition for rover missions[J]. Space Robotics, 2022, 15 (3): 45- 60.

10
苏金树, 张涛. 星载边缘计算架构设计[J]. 计算机学报, 2023, 46 (2): 234- 245.

11
MUELLER R T,SCHMIDT L,VASQUEZ A,et al. Lightweight NLP models for SpaceBorne systems[C]// Proceedings of the 2022 IEEE 21st International Conference on Machine Learning and Applications (ICMLA). Boca Raton,FL,USA:IEEE,2022:134-141.

12
ZHAO Y,ZHOU K,HUANG H,et al. Cross-lingual entity alignment for lunar exploration[C]. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023). Toronto,Canada:Association for Computational Linguistics,2023:892–901.

13
ESA. ExoMars Rover Mission Report[R]. Noordwijk,Netherlands:ESTEC Technical Note TN-2023-004,2023.

14
中国空间科学学会. 空间科学术语命名规范[S]. 北京:中国标准出版社,2021.

15
PETROV I,ZHANG Q,SANTOS L,et al. EventChain:Temporal entity linking for solar physics[C]. Proceedings of the 37th AAAI Conference on Artificial Intelligence (AAAI 2023). Washington,D. C. ,USA:AAAI Press,2023:1282–1290.

16
LIANG Y, HUANG H, ZHOU K, et al. SpaceEval2023: Benchmarking NER in aerospace corpora[J]. ACM Transactions on Asian and Low-Resource Language Information Processing, 2023, 22 (4): 1- 21.

17
IVANOV V, ZHOU K, HUANG H, et al. Cross-lingual alignment of lunar geological entities[J]. Earth and Space Science, 2022, 9 (10): e2022EA002345.

18
NASA. RAD750 processor technical manual[R]. Washington,USA:NASA STI Program,2021.

19
Smith J A, Chen L, Kim Y, et al. AstroBERT: Domain-adaptive pretraining for astronomical text[J]. Nature Astronomy, 2023, 7 (3): 289- 296.

20
SA. Rosetta edge computing architecture design[R]. Noordwijk,Netherlands:ESTEC Technical Note TN-2022-003,2022.

Outlines

/