深度学习论文分享(十一)HyperSign: Hierarchical Hypergraph-based Co-occurrence Modeling for SLR and SLT
深度学习论文分享(十一)HyperSign: Hierarchical Hypergraph-based Co-occurrence Modeling for Sign Language Recognition and Translation
前言
Title:HyperSign: Hierarchical Hypergraph-based Co-occurrence Modeling for Sign Language Recognition and Translation
Authors:Qianren Guo, Yuehang Wang, Yongji Zhang, Qi Chu, Sen Liu, Yu Jiang*
Pub:AAAI Conference on Artificial Intelligence, 2026
在此仅做翻译
Abstract
有效捕获手形、面部表情和身体姿势等共现信号对于手语识别 (SLR) 和翻译 (SLT) 中的语义理解至关重要。 尽管骨架数据比 RGB 输入提供更高的效率和鲁棒性,但现有方法通常依赖于成对图结构,限制了它们对跨身体区域的复杂高阶交互进行建模的能力。 为了解决这个限制,我们提出了 HyperSign,这是一种分层超图神经网络,可以系统地捕获不同身体部位之间的高阶共现模式。 共现图感知模块通过三个互补途径共同学习关系结构:(1) 用于建模物理关节连接的传统图卷积,(2) 通过 k 最近邻构建动态几何超图来编码局部空间模式,以及 (3) 由可学习原型生成的软超图以揭示潜在语义关联。 为了进一步增强结构建模和语义一致性,元部件超图融合模块将手、脸和身体的特征流抽象为统一的超图节点,同时利用经验得出的共现先验来对高阶跨部件依赖关系进行建模。 此外,不确定性感知的协作蒸馏机制引导模型关注关键的身体区域。 对标准 SLR 和 SLT 基准(例如 PHOENIX-2014、PHOENIX-2014T 和 CSL-Daily)的大量实验表明,HyperSign 不仅在速度和准确性方面优于现有的基于骨架的方法,而且在多个评估指标上与几种最先进的基于 RGB 的方法相比,还取得了有竞争力或更好的结果。
1. Introduction
手语是聋人社区内的主要交流方式,通过手、脸和身体的协调动作来传达语义。 这些关节表现出强大的空间结构和复杂的时间动态。 在此背景下,手语识别 (SLR) 旨在将手语视频序列映射到连续的注释级标签流,而手语翻译 (SLT) 通过根据识别的注释生成语法正确且语义流畅的句子来扩展此过程。 由于符号表达固有的复杂性和结构丰富性,这两项任务都带来了重大挑战。

图 1:手语中同时出现的信号的分层超图建模。 该图展示了手语中同时出现的信号,其中表达单位是从手、脸和身体之间的相互作用中产生的。 HyperSign 通过分层超图对这些高阶依赖关系进行建模,以实现准确的光泽度预测和转换。
近年来,基于 RGB 的 SLR 和 SLT 方法取得了实质性进展。 然而,RGB 输入经常遭受视觉冗余并产生高昂的计算成本。 相比之下,骨架数据提供了紧凑且结构化的表示,可以过滤掉不相关的视觉内容,使模型能够专注于手势的基本结构动态。 尽管有这些优点,但基于骨架的方法通常不如 RGB 方法。 CoSign(Jiao et al. 2023)将这种性能差距归因于将所有关键点统一视为单个输入,这阻碍了模型学习结构化语义表示的能力。 为了缓解这个问题,它提出了一种基于部分的策略,将关键点划分为组并单独处理它们,从而保留局部结构信息。基于这个想法,MSKA(Guan et al. 2025)结合了注意力机制来模拟关节间关系的不同强度,使网络能够捕获嵌入骨架拓扑中的潜在依赖关系。 此外,几种基于骨架的 SLR 和 SLT 方法(Pu、Lim 和 Chong,2024 年;Lin 等人,2024 年;Li 等人,2025 年)已经取得了令人鼓舞的进展。 然而,他们的核心建模范式很大程度上仍然局限于成对关系结构。 当负责捕获手语中普遍存在的高阶关系依赖性时,这种建模方案表现出明显的局限性。 在实践中,手语中的表达单元,例如特定的手部配置或传达疑问意图的复合姿势,通常是通过涉及多个关节的协调和同步运动形成的,如图1所示。这些功能实体来自跨越不同身体区域的复杂共现模式,无法用传统的成对图充分表示。
为了解决手语理解中传统成对关系模型的局限性,我们引入了 HyperSign——一种分层超图神经网络框架,专门用于捕获手语表达固有的高阶关系结构。 HyperSign 的核心是一种分层解缠机制,可系统地对多粒度、异构且语义上共存的依赖关系进行建模。 这是通过自下而上的过程实现的,该过程将低级关键点映射到更高级的身体组件,从而实现复杂符号语义的结构化表示。
在关节层面,我们引入了共现图感知(CGP)模块,该模块同时对三种互补类型的结构依赖关系进行建模。 首先,物理图对关节之间的拓扑连接进行编码,捕获内在的解剖学约束。 其次,动态几何超图捕获局部空间相关性以建模协调的关节模式。 第三,可学习的原型超图捕获语义一致性并揭示潜在的共现结构。 通过在结构上解开这些组件,该模块可以对异构图表示进行统一且灵活的建模,从而允许网络在单个框架内共同学习多维空间依赖性和局部共现模式。
在身体部位级别,我们提出了元部件超图融合(MPHF)模块,它将手、脸和身体等关键解剖区域的特征表示抽象为元级别超图的节点。 为了捕获跨身体部位的高阶共现和语义交互,该模块引入了先验引导的元超边,它显式地编码了部位间的关系结构。 此外,为了解释手语表达中信息焦点的动态转移,我们提出了一种不确定性感知协作蒸馏(UACD)机制。 该方法估计每个身体部位流的不确定性,并动态分配可靠性权重以构建加权一致教师。 通过强调更可靠和信息丰富的区域,引导模型在训练期间更有效地关注关键的身体部位。
本文的主要贡献如下:
• 我们介绍了HyperSign,这是一个层次化的超图神经网络,通过首次联合建模关节和身体部分级别的高阶共现,为手语的结构化表示提供了一个新的视角。
• 我们设计了共现图感知和元部件超图融合模块,集成物理结构图、动态几何超图、可学习语义超图和语言信息跨部分超边来模拟从局部关节到整个身体的高阶语义协同。
• 我们引入了不确定性感知协作蒸馏机制,以提高模型对关键身体部位的关注并增强表达理解。
• 在多个标准 SLR 和 SLT 基准上进行的大量实验证明了我们的方法在速度和准确性方面的优越性,优于现有的基于骨架的模型。
2. Related Work
2.1. Sign Language Recognition and Translation
基于骨架的表示由于其对视点变化和遮挡的鲁棒性,在手语识别(SLR)和手语翻译(SLT)领域受到越来越多的关注。 SLR 的目标是将连续的视频或骨架序列转录为词汇级别的单词序列,而 SLT 进一步将这些序列映射为语法正确的口语句子。 大多数现有方法采用 CNN、GCN 或基于 Transformer 的架构来提取时空特征(Niu and Mak 2020;Hu et al. 2023b;Zheng et al. 2023;Jiang et al. 2024;Zhang et al. 2025;Guan et al. 2025)。 例如,CoSign 通过骨架图捕获手和躯干之间的共现模式(Jiao 等人,2023)。 解码通常涉及连接主义时间分类(CTC)(Graves et al. 2006),尽管其弱监督可能会阻碍收敛。 为了缓解这一问题,最近的工作利用框架级知识蒸馏(Chen et al. 2022b;Guo et al. 2023;Guan et al. 2025),提高特征辨别能力。 SLT 通常被建模为神经机器翻译任务,其中视觉编码器从视频输入中提取语义特征,然后将其解码为自然语言文本。 为了提高翻译质量,许多方法都结合了语义级监督,例如在 SLR 上进行预训练或采用联合训练策略(Chen 等人,2022a;Zhou 等人,2021b;Guan 等人,2025)。 在我们的工作中,我们遵循后一种策略,通过 SLR 和 SLT 的统一优化来提高跨任务泛化能力。
2.2. Hypergraph Learning Methods
与传统的成对图结构不同,超图通过超边同时连接多个节点,为复杂的高阶关系建模提供了更具表现力和灵活的机制。 超图学习最早由(Zhou, Huang, and Scholkopf 2006)提出,其核心思想是通过超边构造显式地建模样本之间的高阶依赖关系,并通过超图卷积运算传播信息来增强学习。 随后的研究(Feng et al. 2019;Gao et al. 2022;Lei et al. 2025;Guo et al. 2026)进一步验证了精心设计的超边可以有效捕获非局部和多向交互。 得益于其对复杂结构进行建模的固有能力,超图方法最近已应用于各种视觉任务,并取得了可喜的结果(Feng et al. 2024;Zhou et al. 2024)。
3. Methods
3.1. Preliminaries
我们提出了一个统一的框架 HyperSign,它对基于骨架的 SLR 和 SLT 进行联合建模。 受先前工作(Chen et al. 2022b;Guan et al. 2025)的启发,我们使用 HRNet(Wang et al. 2020)提取 133 个骨骼关键点。 从这些关节中,我们选择了 76 个代表性关节进行下游建模,其中 42 个来自手部,25 个来自面部,9 个来自身体。 如图2所示,HyperSign由两个核心模块组成。 CGP 模块采用来自手、面部、身体和整个骨骼的多流输入来对局部区域内的高阶语义共现模式进行建模。 然后,MPHF 模块通过利用受语言启发的共现先验来显式捕获跨部分的结构依赖性。 为了处理符号表达过程中注意力的动态转移,我们引入了 UACD 机制。

图 2:HyperSign 的详细架构,集成子姿势特征以捕获高阶身体部位关系。
3.2. Co-occurrence Graph Perception Module
为了有效地建模骨架序列中关节之间的高阶语义共现关系,我们设计了CGP模块,它集成了三种互补的拓扑结构:物理结构图、动态几何超图和软语义超图。 这种统一的设计可以从多个角度捕获本地化的协作模式,如图 3 所示。

图 3:共现图感知模块的结构。
给定长度为 T 的骨架序列,我们将其表示为张量 X ∈ RC×T×N,其中 C = 3 表示包含两个归一化空间坐标和一个置信度得分的特征通道,T 是时间长度,N 是所选关键点的数量。 输入张量首先由两个独立的 1×1 卷积分支处理:

其中 R(·) 表示重塑操作。
静态图路径。 GCN 使用固定邻接矩阵 A ∈ RN×N 编码解剖连接来应用。 传统的图卷积运算捕获物理关节关系如下:

动态几何Hypergraph路径。为了模拟关节之间的局部空间邻近性,我们基于时间池姿势特征xB动态地构建了一个K最近邻(KNN)超图。首先,我们应用时间平均池来获得紧凑的表示:

然后我们计算关节之间的成对平方欧氏距离:

对于每个关节 i,我们选择其 k = 8 个最近邻来形成超边,总共产生 N 条超边。 每条超边连接一个中心节点及其对应的 k 个最近节点。 超图使用关联矩阵 Hknn ∈ RN×N 进行编码,其中如果节点 j 属于第 i 个超边(以节点 i 为中心),则 Hknn[i, j] = 1,否则为 0。
软语义超图路径。 为了捕获关节之间的高阶语义共现关系,我们构建了一个基于可学习的基于原型的注意力的软语义超图。 具体来说,我们引入一组 P 个可学习语义原型 Ep ∈ RP×C/2 并计算加权关联矩阵为:

每个条目 Hsoft[i, j] 表示关节 i 与语义原型 j 的软隶属强度,从而形成一组编码跨关节语义亲和力的软超边。
超图计算与融合。为了全面捕捉局部共现模式,我们融合了三条互补路径的输出。具体地说,我们将语义超图和几何超图连接起来,形成统一的关联矩阵:

随后,Xb 通过超图卷积运算传播以获得增强的表示:

其中超图卷积(Gao et al. 2020)定义为:

其中Dv和De分别是顶点和超边的度矩阵,W是超边权重的对角矩阵,θ是可学习的变换矩阵,F是输入节点特征矩阵。
为了自适应地结合结构表示和基于超图的表示,我们采用了门控机制:

其中 σ(·) 表示 sigmoid 激活函数,⊙ 表示 Hadamard 乘积。
最后,融合的特征被重塑并通过 1 × 1 卷积层来调整输出维度。 为了稳定性添加了剩余路径。 得到的特征被输入到时间卷积网络模块中,该模块有效地捕获跨帧的远程时间依赖性:

3.3. Meta-Part Hypergraph Fusion Module
如图2所示,我们提出了MPHF模块来模拟全身区域之间的高层交互。从四级CGP模块的输出中提取零件级特征。具体地说,我们定义了P=5个语义区:左手、右手、脸、身体和整体,每个区域都充当超图中的一个节点。设Xρ∈R4C×T4×N表示部分ρ的特征张量。为了获得帧级别的表示,我们沿关键点维度应用平均池化:Fρ=AvgPoolN(Xρ)∈R4C×T4。然后,将生成的特征转置为主要帧格式,生成EFρ∈R T 4×4C。然后沿零件轴堆叠所有零件特征,以形成统一的元零件表示:XPart∈R T 4×P×4C。
基于身体部位之间共现和协调的先验知识,我们将超边集定义为:

其中节点索引表示:0—整体,1—身体,2—脸部,3—右手,4—左手。 对应的关联矩阵为:

其中每一行对应一个语义部分节点,每列对应一个超边。
超图推理与融合。 为了对不同部分之间的语义依赖性进行建模,我们在通过位置嵌入增强的输入上应用两层超图卷积。 输入定义为:

其中 Epart ∈ R1×P×4C 是可学习的部分级嵌入。 超图推理过程表述为:

它允许语义信息在每个帧内的各个部分之间传播,从而实现高阶协同发音的显式建模。 最终的超图增强特征 Z(2) ∈ R T 4 ×P×4C 沿部分维度分割,并通过残差连接与原始部分特征融合:

其中iρ表示超图节点集中的部分ρ的索引。
3.4. Loss Function
不确定性感知协作蒸馏。 为了进一步增强多视图语义的协作建模,我们引入了UACD机制。 该机制根据不同视觉头的预测分布的熵差异自适应地计算置信度权重,并融合它们的知识来构建软教师分布。 在训练过程中,所有视觉头的输出通过 KL 散度与这位软老师保持一致,引导模型更稳定地关注关键的身体部位。
具体来说,我们沿着通道维度连接所有身体部位的增强特征,以获得融合特征流:Fensemble = Concat � Fρ out 5 ρ=1。 在获得增强的零件级特征和融合表示后,我们将它们输入到六个并行的视觉头模块中。 每个视觉头由线性投影层、非线性激活函数、归一化层和分类输出层组成,独立产生帧级分类输出,表示为{Li ∈ R T 4 ×V | 我= 1,. 。 。 , 6}。 然后,我们将每个视觉头的 logits Li 的预测概率分布计算为 Qi = softmax(Li),并将预测熵估计为不确定性度量:

其中 ϵ 是一个小常数,以确保数值稳定性,V 是类别数。 教师逻辑通过置信加权求和 Lteacher = P6 i=1 wi · Li 获得,其中置信权重计算为 wi = exp(−Hi/τ) P6 j=1 exp(−Hj/τ) ,温度超参数 τ 控制权重分布的平滑度。 然后通过温度因子 Td 对教师 logits 进行软化,以获得软标签分布 Qteacher = softmax(Lteacher/Td),并且每个学生头部预测也类似地软化为 Qi(Td) = softmax(Li/Td)。 最后,蒸馏损失计算为教师分布和每个学生预测之间的平均 KullbackLeibler 散度:

基于 HyperSign 的 SLR。 对于基于骨架的手语识别任务,每个语义流被独立地馈送到由 CTC 损失监督的识别分支中以预测注释序列。 为了进一步增强多视图协作,我们结合了前面描述的基于 UACD 的蒸馏损失 Ldistill。 SLR 总体目标表述为:

其中 α = 0.5 是一个平衡蒸馏损失贡献的超参数。
基于 HyperSign 的 SLT。 对于手语翻译,融合的特征通过轻量级 MLP 投影到预训练的 mBART(Liu 等人,2020)模型的输入嵌入空间中。 整个翻译分支使用识别损失 LSLR 和序列级交叉熵损失 LCE = CrossEntropy(S, ^S) 的组合进行端到端优化,其中 S 和 S^ 分别表示真实句子和预测口语句子。 最终的 SLT 目标定义为

4. Experiments
4.1. Datasets and Evaluation Metrics
我们在手语识别和翻译的三个公共基准数据集上评估了我们的方法:PHOENIX2014(Koller、Forster 和 Ney 2015)、PHOENIX-2014T(Camgoz 等人,2018)和 CSL-Daily(Zhou 等人,2021a)。 PHOENIX-2014 用于 SLR,而 PHOENIX-2014T 和 CSL-Daily 为 SLR 和 SLT 提供注释。 所有消融研究均在 PHOENIX-2014T 数据集上进行。
- PHOENIX-2014. 包含 1,295 个注释的德语手语数据集,其中包含来自 9 个手语者的 5,672 个训练样本、540 个验证样本和 629 个测试样本。 • 菲尼克斯-2014T。 PHOENIX2014 的扩展版本,带有注释和口语翻译,包括 1,085 个注释和 7,096 个训练样本、519 个验证样本和 642 个测试样本。
- PHOENIX-2014-T. PHOENIX2014 的扩展版本,带有注释和口语翻译,包括 1,085 个注释和 7,096 个训练样本、519 个验证样本和 642 个测试样本。
- CSL-Daily。 包含 2,000 个常用注释的大规模中文手语数据集,包含 18,401 个训练样本、1,077 个验证样本和 1,176 个测试样本。
遵循以前工作中的标准做法,我们使用字错误率(WER)作为 SLR 的评估指标,并采用 BLEU(Papineni et al. 2002)和 ROUGE-L(Lin 2004)分数来评估 SLT 性能。
4.2. Implementation Details
我们的架构包括四个连续的 CGP 模块,输出通道分别为 64、128、128 和 256,后面是一个 MPHF 模块。 为了提高效率,时间分辨率降低到输入长度的四分之一。 对于 SLR 任务,我们使用 Adam 优化器训练模型 100 个周期,初始学习率为 1×10−3,批量大小为 4,解码期间波束宽度为 5。 对于 SLT 任务,我们使用预训练的 mBART-large-cc25 模型初始化翻译模块,并使用轻量级 MLP 将骨架特征投影到其输入嵌入空间中。 MLP 以 1 × 10−3 的学习率进行训练,而骨架编码器和翻译模块则以 1 × 10−5 的学习率进行微调。 在与 SLR 相同的设置下训练运行 100 个 epoch。 所有实验均在 Ubuntu 20.04.6 操作系统下使用 PyTorch 2.6.0 框架在单个 NVIDIA RTX A4000 GPU 上进行。
4.3. Comparison with State-of-the-arts
对于 SLR 任务,表 1 中的结果表明 HyperSign 在所有数据集和拆分中始终表现出色。 在 PHOENIX-2014 上,HyperSign 在 DEV 和 TEST 上实现了 18.2% 和 18.8% 的 WER,与 DEV 上的 TwoStream-SLR 相比,WER 降低了 0.2%,与 DEV/TEST 上的 CoSign-2 相比,WER 降低了 1.5%/1.3%。 在 PHOENIX-2014T 上,它在 DEV 和 TEST 上获得了 18.6% 和 19.2%。 虽然在 DEV 上比 TwoStream-SLR 高 0.9%,但在 TEST 上却将 WER 降低了 0.1%。 与 CoSign-2s 和 MSKA 相比,它在 DEV/TEST 上降低了 0.9%/0.9% 和 1.0%/0.6% 的 WER。
对于SLT任务,我们采用ROUGE和BLEU4作为评估指标。 如表 2 所示,HyperSign 在所有数据集和拆分中始终实现最佳性能。 在 PHOENIX-2014T 数据集上,HyperSign 在 DEV 集上获得了 54.36/28.81 的 ROUGE/BLEU4 分数,在 TEST 集上获得了 54.26/29.35 的 ROUGE/BLEU4 分数,分别超过了最好的基于骨架的 SOTA,分别高出了 +1.04/+0.71 和 +0.72/+0.32。 与基于 RGB 的模型相比,HyperSign 在测试集上的 BLEU4 表现优于 TwoStream-SLT(29.35 比 28.95),并实现了与 CV-SLT 相当的 ROUGE 分数(54.26 比 54.54),在不依赖 RGB 输入的情况下展示了具有竞争力的翻译质量。 在 CSLDaily 数据集上,HyperSign 在 DEV 集上的 ROUGE/BLEU4 得分为 55.21/26.39,在 TEST 集上的得分为 56.14/26.87,比 MSKA 高出 +1.18/+1.23 和 +1.07/+1.35。
此外,如表 3 所示,HyperSign 的效率明显高于现有方法,实现了最低的 FLOP 和参数计数,同时提供最快的推理速度。

表 1:PHOENIX-2014、PHOENIX-2014T 和 CSL-Daily 的字错误率(WER %,越低越好)。 最佳结果以粗体显示。

图4:PHOENIX2014T和CSL-Daily数据集的定性翻译结果

Table 2: ROUGE and BLEU4 scores (higher is better) on PHOENIX-2014T and CSL-Daily. 最佳结果以粗体显示。

表 3:PHOENIX-2014T 上的模型复杂性和推理速度。
4.4. Ablation Study
如表 4 所示,我们对 SLR 任务的 PHOENIX-2014T 数据集进行了模块级消融研究。 基线模型由四个时空图卷积层组成,达到了 27.3%/28.1% 的 WER。 引入 CGP 模块,通过对联合级共现进行建模,将性能显着提高到 20.8%/21.1%。 添加 MPHF 模块通过跨部分语义融合进一步将 WER 降低至 18.9%/19.7%。 最后,结合UACD模块得到了18.6%/19.2%的最佳结果。 这些结果证实了每个组件的互补优势,并验证了我们的分层语义建模策略的整体设计。 我们还在 PHOENIX-2014T 数据集上对 CGP 模块中的超参数 K 和 P 进行了联合消融研究,结果如表 5 所示。其中,K 表示动态几何图中最近邻的数量,P 表示语义部分原型的数量。 结果表明,性能通常对这两个参数都很敏感。 当 K = 8 且 P = 8 时,可获得 18.6%/19.2% 的最佳 WER。当 K 或 P 偏离此最佳设置时,性能往往会略有下降。

表 4:PHOENIX-2014T SLR 的模块消融研究(WER,%)。

表 5:SLR PHOENIX-2014T 上 CGP 模块中超参数 K 和 P 的联合消融。 结果以 DEV/TEST 格式报告为 WER (%)。
4.5. Qualitative Analysis
图 4 说明了模型输出和参考文本之间的定性比较。 绿色突出显示表示正确的翻译,而红色突出显示则表示错误的翻译。 HyperSign 在语义和结构上始终与参考一致,而 MSKA 和 MMTLB 经常表现出语义漂移或省略关键信息。 例如,MSKA 引入了不相关的细节(例如“在南方”),而 MMTLB 在中文示例中省略了对比结构并表现出语义混乱。
5. Conclusion
本文介绍了 HyperSign,这是第一个基于骨架的方法,系统地模拟了手语识别和翻译的高阶语义共现。 HyperSign 联合构建物理图、几何超图和语义原型超图,以捕获联合级别的多维共现模式,而元部分超图进一步建模跨区域语义交互。 此外,还引入了不确定性感知协作蒸馏机制,以增强模型对关键表达区域的关注。 实验结果表明,HyperSign 在多个基准测试中的准确性和效率方面均优于现有的基于骨架的方法。
更多推荐
所有评论(0)