Harnessing Causal Structure Alignment for EnhancedCross-Domain Named Entity Recognition 中文版
摘要
摘要:跨领域命名实体识别(NER)是各种实际应用中的关键任务,特别是在目标领域数据有限的情况下。现有的方法主要依赖于特征表示或模型参数共享机制,以实现实体识别能力在不同领域之间的转移。然而,这些方法通常忽略了固有于不变特征中的潜在因果关系。为了解决这一局限性,我们提出了一种新的框架,即基于因果结构对齐的跨领域命名实体识别(CSA-NER)框架,旨在利用因果结构中的因果不变特征来增强实体识别能力的跨领域转移。首先,CSA-NER利用因果发现构建因果特征图,以确定源领域和目标领域之间实体和上下文特征之间的因果关系。随后,它通过图结构对齐,利用图最优输运(GOT)方法提取跨领域的因果不变知识。最后,通过集成门控注意力单元(GAU),获取的因果不变知识得到了进一步的精炼和利用。在五个英语数据集和一个特定的CD-NER数据集上进行的综合实验显示,与现有的跨领域方法相比,CSA-NER模型的平均性能有了显著的改善。这些发现强调了挖掘和利用潜在的因果不变知识对于有效增强目标领域中的实体识别能力的重要性,从而为跨领域自然语言处理的广泛领域贡献了一种强大的方法论。
介绍
命名实体识别(NER)是自然语言处理(NLP)中的基础任务,旨在从文本中识别具有特定语义含义的实体,如人名、地点、组织机构和机构名称。它在知识图谱、信息提取和文本理解等方面发挥着重要作用。在实际应用中,不同领域文本流派和术语的巨大差异构成了重大挑战,经常导致特定目标领域内标注数据的稀缺性。因此,针对跨领域场景,特别是跨领域命名实体识别(CD-NER)的模型适应性在近年来引起了极大的研究关注。这在资源受限的环境中尤为重要,因为标注数据的可用性有限。
目前关于CD-NER的研究主要集中在三种不同的策略上。首先,一些研究人员探索了多任务联合学习方法,通过同时在源域和目标域上训练模型,获得跨任务的精细特征表示,从而增强跨领域实体识别。其次,一组学者提出了旨在理解领域间复杂语义动态的创新模型架构,从而提高了跨领域性能。第三,另一组研究人员利用预训练语言模型(PLM)在数据丰富的领域开发模型,建立了稳健的源域模型。通过微调和领域参数共享技术,他们进一步从源域向目标域传输特征知识,提高了跨领域性能。目前最先进的CD-NER模型之一是Cp-NER,它利用了一个冻结的PLM,并采用协同领域前缀调整来增强PLM,在CrossNER基准测试中取得了显著的跨领域性能改进。
然而,值得注意的是,现有方法通常依赖于跨领域的泛化知识进行跨领域转移,这可能会无意中引入与特定任务要求不符的领域外知识。这一观察结果强调了对CD-NER更加明智的方法的需求,这也是我们提出的基于因果结构对齐的跨领域命名实体识别(CSA-NER)模型旨在解决的挑战。
为了有效地利用领域不变的知识,我们的CSA-NER模型采用了一种策略,即提取领域间的因果不变知识。通过因果学习对领域不变知识进行约束,最终增强目标域的性能。具体来说,图1说明了从上下文和实体中类似句法结构中获取跨领域因果不变知识的过程,其中目标域中的省略号表示省略的文本“good way to”。这个过程需要进行因果推断,以学习实体和隐藏句法结构之间的因果关系。随后,通过使用GOT来对齐相似的因果结构,提取隐藏在句法结构和实体中的因果不变知识。这种方法有助于减轻领域外知识对目标域任务的影响。在各个科学领域中,因果不变性的概念已经得到了广泛的探索。例如,Chevalley设计了一个统一的不变学习框架,巧妙地利用分布匹配来丰富对因果不变知识的获取,从而显著提升了模型的性能。Chen引入了基于因果的不变图学习,用于识别和利用与图数据相关的因果不变知识。通过构建因果图来表示图的分布变化,使模型能够专注于仅包含有关标签潜在原因的最相关信息的子图。此外,Arjovsky认为,源域到目标域的转移导致的虚假相关性与预测目标之间不存在因果关系,并提出了一个不变风险最小化算法,通过使用因果工具来表征数据中的虚假相关性和不变性,从而减轻模型对数据偏差的过度依赖。通过以往研究人员在这些科学领域的研究,本文发现利用因果关系提取领域不变知识可以充分增强跨领域迁移,从而限制引入与给定任务不一致的领域外知识。本文的贡献总结如下:
• 本文提出了一种利用特征之间的因果不变知识来改善跨领域命名实体识别(CD-NER)的新方法。通过利用因果不变知识在不同领域之间的稳定性,该方法有助于有效地在不同的数据环境之间传递知识。
• 提出的基于因果结构对齐的跨领域命名实体识别模型在嵌入层中加入了一个因果对齐模块,通过识别特征之间的因果关系来构建一个因果特征图。通过图优化传输(GOT)的对齐度量,它获取了因果不变知识,减轻了领域之间的负迁移效应。此外,在隐藏层中使用了门控注意力单元(GAUs)来增强对因果不变知识的利用,从而在目标域中提取更高效的特征表示。
• 提出的方法和建模方法通过对包括五个英文数据集和一个专有的跨领域命名实体识别数据集在内的多种数据源进行了严格的实验验证。实验结果证实了在特征中包含因果不变信息的有效性,显示出其在促进跨领域命名实体识别知识转移中的重要作用。

releated work
2.1. 跨领域命名实体识别
跨领域命名实体识别旨在利用从资源丰富的源域学到的知识来提高目标域中的实体识别,因此受到越来越多的研究关注,因为它可以缓解数据依赖性和训练数据不足的问题。张等人提出了一个多单元组合LSTM结构,将每种实体类型建模为一个单独的单元状态,从而解决了数据标注稀缺和实体歧义的问题。这些方法需要在大量的源域数据上进行训练以适应每个域,使得它们耗时且效率低下。胡等人提出了一个新的自回归建模框架,利用领域之间的语义关系将源域中具有相同标签的语义特征迁移到目标域,以共同预测实体标签。郑等人通过预训练语言模型构建了一个带标签的图,并通过动态图匹配解决了跨领域标签语义特征不匹配的问题。陈等人利用冻结的PLMs并进行协作的领域前缀调整,激发PLMs处理各种领域NER任务的潜力。相比之下,基于传递语义特征知识的先前方法不能很好地解决负迁移问题,因此未能通过利用源域中存在的因果不变知识产生更稳定的预测。因此,本文的方法通过构建源域和目标域之间的特征之间的因果关系来构建因果特征图,并通过GOT进行图匹配来学习源域中的因果不变知识,以缓解在目标任务中使用源任务知识可能产生的负面影响。此外,该模型的训练参数较少,耗时较短,并且可以与不同的骨干模型结合以获得更好的适应性。
2.2. 少样本命名实体识别
少样本命名实体识别(FS-NER)旨在在资源匮乏的场景中识别新类别,并突出了良好的跨领域能力。Fritzler利用原型网络实现了少样本的实体识别。Tong提出了挖掘未定义类别来提高模型的鲁棒性,从而更好地适应少样本学习。Cui将提示学习模板和BART模型结合起来,用于引导实体识别,以提高模型性能和跨领域应用。文献[17]的作者甚至不需要一个资源丰富的源域,就能通过提示学习来完成无需模板调整的小样本学习。文献[9]的作者通过提取资源丰富的源域中标签的语义信息,改进了低资源域中的领域适应性。尽管上述方法在小样本学习方面取得了显著改进,但它们只通过少样本训练改进了模型的领域适应性和泛化能力,而没有考虑到迁移的因果不变知识在下游任务中发挥关键作用。因此,本文方法与上述方法的主要区别在于,它不仅适用于资源丰富和资源匮乏的领域,而且更有效地利用因果不变知识来提高少样本识别能力。
3.方法
3.1 模型架构
CSA-NER架构主要由2个关键模块组成,如图2所示,第一个模块是因果对齐模块,通过因果学习和统计分析构建因果特征图,并利用GOT在因果特征图中提取因果不变知识。第二个模块是特征交互模块,它通过GAU捕获域之间的关联信息,以进一步强化在目标域中学习到的因果不变知识。

3.2.因果对齐模块
为了精确识别和有效传递嵌入特征表示中的因果不变知识,CSA-NER引入了一个复杂的因果对齐机制。该机制的目的是精心构建和对齐嵌入层内的因果特征图。利用这个模块的主要驱动力是增强模型以捕获和传递因果关系,从而提高NER系统的整体鲁棒性和性能。
3.2.1.因果特征图
在本节中,我们介绍构建因果特征图以阐明特征之间的因果关系。构建因果特征图的主要目标是识别和利用实体特征和句子上下文特征之间固有的因果连接。在概念上,因果图被表示为一个有向图,其中节点对应于特征,边表示这些特征之间的依赖关系。这些依赖关系可以通过因果关系的存在来近似。因果特征图表示为G={V,F},其中V={v1,v2,…,vn},V∈RN×h,F={f1,f2,…,fn},其中h表示特征维度。每个节点νi∈V表示句子中实体和上下文的特征表示,而每条有向边fi∈F表示两个节点之间的因果关系。为了编码G中的这些因果关系,我们使用邻接矩阵W(f)∈RN×N。构建因果特征图对于理解和捕获特征之间错综复杂的因果依赖关系至关重要,为所提方法的后续阶段提供了基础结构。特征空间中的因果结构通过使用有向无环图(DAGs)的现有因果学习框架来表示,在独立同分布条件下给定序列X∈RN×h,其中N是节点特征数量。因果学习的目标是推断节点特征空间的因果结构,特别是提取节点之间隐藏的实体和句法结构之间的因果关系。这个过程需要构建一个这个过程需要构建一个因果特征图,以了解因果链接,从而获得节点之间更高阶的特征表示。在本文中,通过将结构方程模型(SEM)扩展到因果学习,以更好地理解变量之间的因果关系,从而有助于从序列X中恢复DAG结构W(f)。计算如下:
f^(-1)(X) = W(f)^T * f^(-1)(X) + g(Z) (1)
其中,Z∈RN×h表示相应的噪声矩阵,f和g是X和Z的参数化函数。基于变分贝叶斯的因果学习通过最小化变分后验分布pθ(Z|X)的Kullback-Leibler(KL)散度来近似真实后验分布qψ(Z|X)。在这个背景下,KL散度是两个概率分布之间的差异度量。通过最小化KL散度,可以使变分后验分布pθ(Z|X)尽可能接近真实后验分布qψ(Z|X)。这意味着我们希望变分后验分布尽可能接近真实后验分布,以更好地获得近似因果关系,计算如下:
argminθ,ϕ DKL(qϕ(Z|X)∥pθ(Z|X)) = argminθ,ϕ ∫qϕ(Z|X)log(qϕ(Z|X)/pθ(Z))pθ(X|Z)dZ = argminθ,ϕ DKL(qϕ(Z|X)∥pθ(Z)) - Eqρ(Z|X) log(pθ(X|Z)) (2)
其中,DKL是KL散度,θ=(MX, SX)和ϕ=(Mz, Sz)分别是生成和变分参数。方程(2)中得到的损失函数称为期望下界,其负形式称为变分下界或证据下界,并且给定Z的分布和一组序列X1,X2,…,XN,损失可以定义为平均负下界,表示为:
LELBO = DELBO - EELBO
DELBO = -1/n * ∑(n from 1 to n)DKL(qϕ(Z|Xk)∥pθ(Z))
EELBO = Eqθ(Z|Xk)log(pθ(Xk|Z)) (3)
通过使用贝叶斯神经网络(BNNs)的概率编码器和解码器,可以获得密度函数qϕ(Z|Xk)和pθ(Xk|Z)。具体来说,通过将输入数据Xk映射到潜在空间Z并在编码器使用BNNs实例化f^(-1)和常量映射g时获得变分后验分布参数qϕ(Z|Xk)的参数MZ和SZ。解码器将潜在变量Z解码为生成或重构的输入数据X,使用f和g的逆函数,并获得真实后验分布pθ(Xk|Z)的参数MZ和SZ。真实后验分布表示给定潜在变量Z时生成或重构的输入数据X的不确定性分布。考虑到无环性约束,因果学习通过使用带有L1正则化的增广Lagrange方法将变为以下优化问题进行计算:
W(f),Θ = argmin(W(0),Θ)(-LELRO+L1)

在这里,tr是矩阵I+αW(f)◦W(f) S的迹,θ是变分自编码器中BNN的一组参数,α是拉格朗日乘子,ρ是惩罚参数。通过使用方程(4) - (6)进行优化来更新α并增加ρ,之后使用随机优化求解器来获得邻接矩阵W(f)和θ。因此,在本文中,通过使用V来确定节点的特征表示,使用W(f)来描述特征之间的因果关系,我们不仅可以获得源域因果图中节点表示VS和因果边表示W(f)S,还可以获得目标域因果图中的节点表示VT和因果边表示W(f)T。
3.2.2. 因果结构对齐
在特征表示中的因果结构对齐不仅对齐了因果图中的节点特征,还对齐了节点特征之间的相似因果关系,使模型能够捕获标记特征之间的因果结构信息,从而学习到更具代表性的原始语义信息的因果不变特征。该模型在嵌入层使用GOT[28]作为因果对齐方法来获得特征表示中的因果不变知识,如图3所示。图优化传输有两个最优传输距离目标,一个是用于节点(标记)匹配的Wasserstein距离(表示为WD),另一个是用于边(因果)匹配的Gromov-WD(GWD),使用两种形式的最优传输框架将跨域传输转换为从一个域分布到另一个域分布的因果表示。GWD是一种自标准化的对齐方法,可以提高使用特征信息推理可解释因果关系的效率。模型通过使用因果特征图获取因果矩阵W(f)S和W(f)T,从而获得跨域因果相似性矩阵W(f)ST,其计算如下:

3.4. 优化目标
训练过程中使用变分贝叶斯(Variational Bayes)在嵌入层计算变分损失LELBO,以优化域之间存在的因果关系,随后通过图优化传输完成对齐损失LGOT,最后在编码层引入交叉熵损失函数(CE)来计算GAU的损失LGAU,计算公式如下:
其中,WG∈Rh×c,其中c表示标签的类别数,YT表示目标域中的真实标签。总之,CSA-NER的整体损失函数可以表示为:
更多推荐
所有评论(0)