image-20260811081529844

论文标题: ReMoE: Report-Guided Mixture-of-Experts for Multimodal OCT/OCTA Anomaly Detection

作者: Zihan Nie, Qincheng Qiao, Muhao Xu, Wei Feng, Xinguo Hou, Weiye Song, Zongyuan Ge

发表年份: 2026

关键词: Medical anomaly detection; Multimodal OCT/OCTA; Report-guided learning; Mixture-of-Experts; Vision-language models


一、研究动机:为什么需要这项研究?

1.1 视网膜多模态影像异常检测:数据稀缺下的常态建模

医学异常检测的核心任务是识别偏离正常模式的样本,而监督学习在医学场景中往往举步维艰:异常病例稀少、类别多样且标注不完整。因此,无监督或少样本的常态建模成为更现实的选择——模型仅在正常数据上学习“何为正常”,再在测试时检测偏离。在视网膜成像领域,光学相干断层扫描(OCT)能够呈现视网膜层结构、组织连续性与黄斑形态,而 OCT 血管造影(OCTA)则捕捉血管模式、血流分布与灌注状态。这两种模态在结构信息与功能信息上高度互补,理应让正常性的刻画更加丰富。然而,多模态也带来了新的复杂性:正常状态不仅由每个模态各自的视觉模式共同决定,还受到跨模态关系与解剖语义组织的约束。因此,简单的图像拼接或特征融合并不足以刻画这种深层的多模态常态。

1.2 视觉中心范式的瓶颈:异常评分停留在表观差异

现有的无监督异常检测方法大致可分为几类:

基于重建残差的方法(如 DRAEM、AnoDDPM)假设正常样本能被更好地重建;

基于特征分布的方法(如 PaDiM、PatchCore、SPADE)通过记忆正常特征库来衡量测试样本的偏离;

基于编码器-解码器差异的方法(如 RD4AD、Dinomaly、URD)则比较瓶颈前后特征的差异。

这些视觉中心范式都将异常分数建立在原始视觉偏差之上——像素或特征空间中的距离越大,异常分数越高。

但在视网膜检查中,临床报告对“正常”的描述是语义层面的:视网膜各层完整、血管分布规则、未见明显结构破坏等。同一个表观区域在不同语义背景下可能具有不同的临床意义;反之,某些 subtle 的视觉变化只有放到报告语义中才构成真正的异常。因此,仅依赖视觉差异会让模型把无关的纹理噪声当作异常,或者漏掉那些视觉轻微但语义关键的病变。

1.3 文本报告作为“语义正常性”的来源

医学视觉-语言学习(Medical Vision-Language Learning)的研究已经证明,配对的医学图像与报告能够学到比纯视觉更强的可迁移表示,例如 GLoRIA 的全局-局部对齐、ConVIRT 的图像-报告对比学习,以及 MedCLIP 在未配对数据上的扩展。然而,这些工作主要服务于分类或检索任务,鲜有研究将报告语义蒸馏进异常检测的“差异计算”过程。

ReMoE 的出发点正是:如果把正常报告描述视为一种高层语义先验,并将其转化为与模态/slab 相关的条件,就可以在编码器-解码器特征差异计算之前对特征进行调制,使异常分数不再是裸眼视觉差异,而是在“报告指导下的语义感知差异”。这一思路将多模态异常检测从“视觉融合”推进到“语义-视觉对齐”的层次。

image-20260811080716285

图 1 以对比形式阐述了本文的核心动机。左侧“Visual-Centric AD”支路仅使用视觉编码器与视觉解码器计算原始差异(Raw Discrepancy),异常图/分数完全由视觉特征差异驱动;右侧“ReMoE (Ours)”支路在同样拥有 Visual Encoder 与 Visual Decoder 的基础上,额外引入了一个 Prior Student 与一个 Prior Teacher 进行蒸馏,把 Normal Report 的语义通过 Report Embedding 与 Modality Anchor 结合后,注入到 Report Modulation 模块,最终产生 Semantic-Aware Discrepancy。图中用箭头清晰展示了训练阶段(Prior Teacher 蒸馏到 Prior Student)与测试阶段(Student 预测伪文本先验)的数据流,并用“+”号表示报告嵌入与模态锚点的相加。最下方的两张异常热图形成鲜明对比:视觉中心方法的异常响应较为弥散,而 ReMoE 的响应更聚焦。这张图用极简的视觉语言说明了一个关键转变——异常检测不再只看“像不像”,而要看“是否符合报告描述的正常语义”。


二、核心创新:本文贡献了什么?

创新点一:图像到文本的先验学生:从正常报告中蒸馏语义参考。 作者设计了一个轻量的 image-to-text prior student,在训练时用冻结 CLIP 文本编码器提取的正常报告嵌入作为监督目标,蒸馏出一个能从视觉特征预测伪文本表示的学生网络。推理时,学生不需要真实报告,仅根据输入视觉特征即可预测与正常语义相关的伪文本。这与 UF-MADS 等直接使用文本原型的方法不同:ReMoE 的伪文本表示是图像条件化、样本自适应的,因此能够对不同病例给出不同的语义参考。

创新点二:模态感知先验:将共享语义解耦到模态/slab 方向。 为了让报告语义能够对应到 OCT 结构层、OCTA 血管图等不同模态,作者为每种输入模态定义了一个文本描述(例如“superficial OCT”“deep OCTA”),用 CLIP 文本编码器生成模态锚点。伪文本表示与对应模态锚点相加后再经过投影,得到既保留共享正常语义、又具备模态/slab 方向的先验。这种设计显式地把“正常报告说什么”与“当前模态看什么”联系了起来。

创新点三:报告引导的模态调制(RMM):语义驱动的专家路由。 RMM 是方法的核心操作单元。它首先对视觉特征做多尺度上下文校准,然后利用模态感知先验预测不同模态条件下的专家路由权重,驱动一组具有不同感受野(1×1、3×3、5×5 深度可分离卷积)的视觉专家,最后对专家响应做多模态平均聚合,并以残差方式调制编码器/解码器特征。这里的专家路由不是由视觉特征本身决定,而是由“语义先验+视觉上下文”共同决定,因此专家组合能够随模态和语义变化。

创新点四:端到端融入编码器-解码器差异框架。 与把文本当作后处理分类头的方法不同,ReMoE 将报告先验嵌入到编码器-解码器差异计算之前:调制后的特征 eE 与 eD 再计算余弦差异。这意味着异常分数直接反映了“在报告语义指引下,解码器重建/恢复的视觉表示是否仍与编码器提取的语义调制表示一致”。这种前置调制让文本语义真正改变了异常度量的几何,而不是仅仅用于筛选结果。

2.1 与现有工作的本质区别

与现有工作相比,ReMoE 的定位非常清晰。AnyAD 和 UniMMAD 等近期多模态异常检测方法关注的是如何在输入模态缺失或任意组合的情况下保持一致性,它们没有引入报告语义;Dinomaly、URD 等方法虽然利用了 DINOv2 等基础视觉特征,但仍然停留在视觉中心的差异建模;UF-MADS 虽然使用文本原型引导异常检测,但依赖预定义的文本提示,并未像 ReMoE 这样通过蒸馏把配对报告转化为图像条件的伪文本先验,也未通过 MoE 路由将语义条件显式作用于多模态特征调制。因此,ReMoE 把“文本-视觉对齐”与“多模态异常检测”结合得更紧密,同时保留了编码器-解码器差异框架的工程简洁性。


三、方法原理:ReMoE:报告引导的混合专家调制

image-20260811080829140

图 2 是 ReMoE 的整体架构图,几乎浓缩了论文的全部设计思想。详细理解清楚这个图就理解了大部分本文思想。为了让读者有条理地吃透这张图,我们可以顺着数据流动的方向,将其拆解为三个协同工作的模块:视觉特征的提取(中轴)语义先验的生成(左侧),以及特征的调制与比对(右侧与中心交汇处)。注意图例中的小细节:雪花图标代表冻结的参数(不更新),火焰图标代表可训练的参数,实线代表仅在训练时使用,虚线则代表测试时的通路。

(1)主轴:多模态数据的输入与视觉特征提取

把目光投向图的左上角,模型的输入是属于同一个患者的四张图像拼接而成的张量:包含浅层和深层的 OCT 以及 OCTA(Superficial/Deep OCT 和 OCTA)。 这组数据首先被送入顶部的 DINOv2-R ViT Encoder。注意到它旁边有一个“雪花”图标,这意味着这是一个经过预训练且被冻结(Frozen)的强大视觉编码器。它负责从图像中提取出不同层级的原始视觉特征,图中标注了低层特征(Lower-Level Feature E1E_1E1)和高层特征(Higher-Level Feature ELE_LEL)。 随后,数据流向下经过一个可训练的瓶颈层(Bottle Neck),进入底部的网络。(这里有一个专业细节:图中底部标注为 DINOv2-R ViT Encoder 并带有火焰图标,实际上对应的是论文正文里提到的可训练的 ViT 解码器(Decoder),它负责将特征重新映射回对应的维度,输出解码器特征 D1D_1D1DLD_LDL

(2)左侧翼:报告引导的语义先验生成(最出彩的设计)

这是整个网络获得“医学常识”的知识库,对应图左侧的紫色和绿色区块。

  • 训练阶段的“老师”:在图的左下角,医生撰写的“正常报告(Normal Report)”被输入到一个被冻结的 CLIP Prior Teacher(文本编码器)中,提取出纯正的文本语义特征。
  • 被倒逼学习的“学生”:因为在真实测试时我们是没有这份报告的,所以作者设计了一个带有火焰图标的 Image-to-Text Prior Student(图像到文本先验学生网络)。它接收视觉特征,试图预测出一段“伪文本表示”。模型通过计算 LRSD\mathcal{L}_{RSD}LRSD(报告语义蒸馏损失),强制学生网络生成的特征向 CLIP 老师提取的真实报告语义靠拢。
  • 结合模态常识:为了让网络知道当前处理的是哪一种具体的影像(比如是 OCT 还是 OCTA),系统还将“模态文本(Modality Text)”转化为锚点,与学生网络预测的语义进行融合,最终输出了一个绿色的模块——模态感知先验(Modality-Aware Prior)。这个先验不仅懂图像,还懂模态特有的医学语义。

(3)右侧翼与交汇:RMM 调制与异常得分计算

接下来,视觉特征(浅蓝色方块)和刚刚生成的模态感知先验(绿色方块)在黄色的 RMM(Report-Guided Modality Modulation) 模块中相遇了。图 2 右侧的虚线框将 RMM 的内部运作进行了放大剖析:

  • 专家库与路由分配:首先,视觉特征经过多尺度的视觉上下文校准(Visual Context Calibration)。同时,模态感知先验被送入一个语义路由器(Semantic Router)。这个路由器就像一个指挥官,它根据当前的医学语义,为下方的视觉专家库(Visual Expert Bank,包含 E1,…,EK\mathcal{E}_1, \dots, \mathcal{E}_KE1,,EK)分配不同的注意力权重。
  • 语义加权聚合:不同的专家通过不同大小的卷积核(感受野)处理视觉特征,然后根据路由器分配的权重,将所有专家的处理结果进行语义专家聚合(Semantic Expert Aggregation)
  • 经过这一系列操作,原本“纯视觉”的特征,就被成功改造成了“被报告语义调制过的特征(Report Modulated Feature)”,也就是图中间带有波浪号的 E~1,E~L,D~1,D~L\tilde{E}_1, \tilde{E}_L, \tilde{D}_1, \tilde{D}_LE~1,E~L,D~1,D~L

(4)最终的异常判定

最后,回到图的中央区域。模型会对经过语义调制的编码器特征(E~\tilde{E}E~)和解码器特征(D~\tilde{D}D~)计算余弦差异。

  • 在训练时,通过最小化 LRMR\mathcal{L}_{RMR}LRMR(报告调制重建损失),让两者对正常样本的输出尽可能一致。
  • 在推理测试时,如果输入了一张包含病变的异常图像,因为病变破坏了正常的语义规律,导致 RMM 路由分配失常,编码器和解码器的输出特征就会在病变区域产生巨大的差异。将不同层级(如层 1 到层 LLL)的这种差异汇总,就生成了右侧那张色彩斑斓的异常得分图(Score / Anomaly Map)

3.1 问题设定与符号

ReMoE 接收同一病例的 M=4 个单通道视网膜输入:浅层 OCT(OCT-S)、深层 OCT(OCT-D)、浅层 OCTA(OCTA-S)与深层 OCTA(OCTA-D)。这些输入沿通道维度拼接为张量 X∈RB×M×H×WX \in \mathbb{R}^{B \times M \times H \times W}XRB×M×H×W,其中 B 为批量大小。为了复用预训练在 3 通道上的 DINOv2-R ViT 输入投影,作者将原始 3 通道权重沿通道平均,重复 M 次后再按 3/M3/M3/M 缩放,得到 M 通道输入投影,并冻结该层。视觉主干包含冻结的 DINOv2-R ViT-S/14 编码器、可训练瓶颈层与可训练 ViT 解码器。借鉴 Dinomaly,编码器与解码器的中间 Transformer 特征通过跨层平均聚合为 LLL 个层级特征 El,Dl∈RB×C×h×wE_l, D_l \in \mathbb{R}^{B \times C \times h \times w}El,DlRB×C×h×w

X∈RB×M×H×W,El,Dl∈RB×C×h×w,l=1,…,L. X \in \mathbb{R}^{B \times M \times H \times W}, \quad E_l, D_l \in \mathbb{R}^{B \times C \times h \times w}, \quad l=1,\dots,L. XRB×M×H×W,El,DlRB×C×h×w,l=1,,L.

这里 XXX 是 M 个模态/slab 拼接后的输入张量,ElE_lElDlD_lDl 分别表示第 l 个层级上编码器与解码器的视觉特征。跨层聚合把不同深度的 Transformer 特征融合成多尺度表示,为后续的层级差异计算提供基础。

3.2 报告语义蒸馏:从配对报告到伪文本表示

在训练阶段,每个正常样本都配有一份临床报告 rbr_brb。冻结的 CLIP 文本编码器 ftextf_{\text{text}}ftext 将报告编码为 L2 归一化的文本嵌入 tbt_btb,作为蒸馏目标。与此同时,一个轻量的 image-to-text prior student 对编码器或解码器侧的视觉特征 Fb,lqF^q_{b,l}Fb,lq 先做全局平均池化(GAP),再经线性投影得到同样维度的伪文本表示 sb,lqs^q_{b,l}sb,lq。报告语义蒸馏损失鼓励这些伪文本表示与真实报告嵌入在余弦相似度意义下对齐。通过这种方式,学生网络学会在测试时没有报告的情况下,根据输入视觉特征“预测”出相应的正常语义描述。

tb=Norm(ftext(rb)),sb,lq=Norm(Wsq GAP(Fb,lq)), t_b = \mathrm{Norm}\bigl(f_{\text{text}}(r_b)\bigr), \qquad s^q_{b,l} = \mathrm{Norm}\Bigl(W^q_s \, \mathrm{GAP}(F^q_{b,l})\Bigr), tb=Norm(ftext(rb)),sb,lq=Norm(WsqGAP(Fb,lq)),

tb∈Rdt_b \in \mathbb{R}^dtbRd 是冻结 CLIP 从真实报告提取的归一化语义目标,sb,lq∈Rds^q_{b,l} \in \mathbb{R}^dsb,lqRd 是学生从第 qqq 侧(编码器 q=Eq=Eq=E 或解码器 q=Dq=Dq=D)第 lll 层视觉特征预测的伪文本。WsqW^q_sWsq 是可学习投影。注意学生参数在同一网络侧的不同层级之间共享,以保证参数效率。

LRSD=12BL∑q∈{E,D}∑b=1B∑l=1L(1−⟨sb,lq, tb⟩). \mathcal{L}_{\text{RSD}} = \frac{1}{2BL} \sum_{q \in \{E,D\}} \sum_{b=1}^{B} \sum_{l=1}^{L} \Bigl(1 - \bigl\langle s^q_{b,l}, \, t_b \bigr\rangle\Bigr). LRSD=2BL1q{E,D}b=1Bl=1L(1sb,lq,tb).

由于 sb,lqs^q_{b,l}sb,lqtbt_btb 都已 L2 归一化,内积等于余弦相似度。损失 1−⟨⋅,⋅⟩1 - \langle \cdot, \cdot \rangle1, 等价于余弦距离,迫使学生的伪文本表示在训练样本上逼近真实报告的语义方向。测试时偏离正常的样本会产生不同的伪文本,从而为 RMM 提供不同于训练分布的语义条件。

3.3 模态感知先验与 RMM

为了让伪文本具有模态特异性,作者首先为每个模态定义文本描述 umu_mum(如“superficial OCT”“deep OCTA”),并用 CLIP 文本编码器生成模态锚点 ama_mam。伪文本表示与对应模态锚点相加并归一化后,通过两个轻量投影头:一个预测图像条件化的语义分量 pb,l,mq,stup^{q,\text{stu}}_{b,l,m}pb,l,mq,stu,另一个预测该分量的贡献系数 γb,l,mq\gamma^q_{b,l,m}γb,l,mq。同时,模态锚点本身也经投影头变换为模态特定分量 pmq,ancp^{q,\text{anc}}_mpmq,anc。最终,模态感知先验将锚点方向作为基线,用图像条件化分量进行自适应修正,其中 αq\alpha^qαq 是一个可学习的全局缩放参数,用 tanh⁡\tanhtanh 限制其范围。

am=Norm(ftext(um)),rb,l,mq=Norm(sb,lq+am),pb,l,mq,stu=Norm(ϕsq(rb,l,mq)),γb,l,mq=σ([gγq(rb,l,mq)]m),pmq,anc=ϕaq(am),pb,l,mq=pmq,anc+tanh⁡(αq) γb,l,mq pb,l,mq,stu. \begin{aligned} a_m &= \mathrm{Norm}\bigl(f_{\text{text}}(u_m)\bigr), \\ r^q_{b,l,m} &= \mathrm{Norm}\bigl(s^q_{b,l} + a_m\bigr), \\ p^{q,\text{stu}}_{b,l,m} &= \mathrm{Norm}\Bigl(\phi^q_s\bigl(r^q_{b,l,m}\bigr)\Bigr), \\ \gamma^q_{b,l,m} &= \sigma\Bigl(\bigl[g^q_\gamma(r^q_{b,l,m})\bigr]_m\Bigr), \\ p^{q,\text{anc}}_m &= \phi^q_a(a_m), \\ p^q_{b,l,m} &= p^{q,\text{anc}}_m + \tanh(\alpha^q) \, \gamma^q_{b,l,m} \, p^{q,\text{stu}}_{b,l,m}. \end{aligned} amrb,l,mqpb,l,mq,stuγb,l,mqpmq,ancpb,l,mq=Norm(ftext(um)),=Norm(sb,lq+am),=Norm(ϕsq(rb,l,mq)),=σ([gγq(rb,l,mq)]m),=ϕaq(am),=pmq,anc+tanh(αq)γb,l,mqpb,l,mq,stu.

ama_mam 是第 mmm 个模态的语义锚点,rb,l,mqr^q_{b,l,m}rb,l,mq 把样本级伪文本与模态方向融合,ϕsq\phi^q_sϕsq 将融合后的语义投影到视觉通道空间,gγqg^q_\gammagγq 预测该图像条件分量应占多大权重,σ\sigmaσ 为 sigmoid。pmq,ancp^{q,\text{anc}}_mpmq,anc 保留了模态本身的语义方向,而 pb,l,mqp^q_{b,l,m}pb,l,mq 在此基础上根据当前图像自适应地修正,形成最终进入 RMM 的模态感知先验。

RMM 的设计意图是把模态感知先验转化为对视觉特征的条件化调制。它包含四个连续步骤:多尺度视觉上下文校准、语义路由生成、视觉专家响应计算、以及响应聚合与残差输出。首先,对视觉特征做并行多尺度深度可分离卷积,并以残差形式得到校准后的视觉表示。接着,将先验投影到视觉空间并与校准特征相加,经全局池化和 softmax 得到每个模态对每个专家的权重。同时,K 个具有不同感受野的专家独立作用于校准特征。最终,按模态-专家权重聚合响应,并以残差方式输出报告调制特征。

Hlq=Vlq+Clq(Vlq),Gb,l,mq=Hb,lq+ψlq(pb,l,mq),wb,l,mq=Softmax(Rlq(Gb,l,mq)),Ob,l,kq=El,kq(Hb,lq),Ub,lq=1M∑m=1M∑k=1Kwb,l,mq(k) Ob,l,kq,V~b,lq=ηlq(Hb,lq+Ub,lq). \begin{aligned} H^q_l &= V^q_l + C^q_l(V^q_l), \\ G^q_{b,l,m} &= H^q_{b,l} + \psi^q_l\bigl(p^q_{b,l,m}\bigr), \\ w^q_{b,l,m} &= \mathrm{Softmax}\Bigl(R^q_l\bigl(G^q_{b,l,m}\bigr)\Bigr), \\ O^q_{b,l,k} &= E^q_{l,k}\bigl(H^q_{b,l}\bigr), \\ U^q_{b,l} &= \frac{1}{M} \sum_{m=1}^{M} \sum_{k=1}^{K} w^q_{b,l,m}(k) \, O^q_{b,l,k}, \\ \widetilde{V}^q_{b,l} &= \eta^q_l\bigl(H^q_{b,l} + U^q_{b,l}\bigr). \end{aligned} HlqGb,l,mqwb,l,mqOb,l,kqUb,lqVb,lq=Vlq+Clq(Vlq),=Hb,lq+ψlq(pb,l,mq),=Softmax(Rlq(Gb,l,mq)),=El,kq(Hb,lq),=M1m=1Mk=1Kwb,l,mq(k)Ob,l,kq,=ηlq(Hb,lq+Ub,lq).

HlqH^q_lHlq 是经过多尺度上下文校准后的视觉特征;Gb,l,mqG^q_{b,l,m}Gb,l,mq 将语义先验注入视觉空间,形成路由特征;RlqR^q_lRlq 是语义路由器,输出 K 维 softmax 权重;El,kqE^q_{l,k}El,kq 是第 k 个视觉专家;Ub,lqU^q_{b,l}Ub,lq 对所有模态和专家做加权平均;最后的 V~b,lq\widetilde{V}^q_{b,l}Vb,lqE~b,l\widetilde{E}_{b,l}Eb,lD~b,l\widetilde{D}_{b,l}Db,l,是报告调制后的特征。整个过程把“报告语义”转化成了对视觉特征的空间-通道重标定。

3.4 报告调制重建、总损失与推理

LRMR=1BL∑b=1B∑l=1L(1−cos⁡(vec(E~b,l), vec(D~b,l))),Ltotal=LRMR+λRSDLRSD,A=1L∑l=1LUp(1−cos⁡c(E~l,D~l)),s(X)=1∣Ωρ∣∑(i,j)∈ΩρA(i,j). \begin{aligned} \mathcal{L}_{\text{RMR}} &= \frac{1}{BL} \sum_{b=1}^{B} \sum_{l=1}^{L} \Bigl(1 - \cos\bigl(\mathrm{vec}(\widetilde{E}_{b,l}), \, \mathrm{vec}(\widetilde{D}_{b,l})\bigr)\Bigr), \\ \mathcal{L}_{\text{total}} &= \mathcal{L}_{\text{RMR}} + \lambda_{\text{RSD}} \mathcal{L}_{\text{RSD}}, \\ A &= \frac{1}{L} \sum_{l=1}^{L} \mathrm{Up}\Bigl(1 - \cos_c\bigl(\widetilde{E}_l, \widetilde{D}_l\bigr)\Bigr), \\ s(X) &= \frac{1}{|\Omega_\rho|} \sum_{(i,j) \in \Omega_\rho} A(i,j). \end{aligned} LRMRLtotalAs(X)=BL1b=1Bl=1L(1cos(vec(Eb,l),vec(Db,l))),=LRMR+λRSDLRSD,=L1l=1LUp(1cosc(El,Dl)),=Ωρ1(i,j)ΩρA(i,j).

训练时 LRMR\mathcal{L}_{\text{RMR}}LRMR 让调制后的编码器与解码器特征在 normal 样本上尽量一致,λRSD=0.15\lambda_{\text{RSD}}=0.15λRSD=0.15 平衡视觉重建与报告蒸馏。推理时,cos⁡c\cos_ccosc 表示逐空间位置的通道余弦相似度,Up\mathrm{Up}Up 双线性上采样到输入分辨率;Ωρ\Omega_\rhoΩρ 是异常图中响应最高的 top-ρ\rhoρ 像素集合,作者取 ρ=0.01\rho=0.01ρ=0.01,用其平均值作为图像级异常分数,既突出局部异常证据,又避免背景平均稀释信号。


四、实验结果:图表解读与数值分析

4.1 实验设置

实验在两个设置上进行。第一个是作者收集的私有 OCT/OCTA 数据集,包含配对的多模态视网膜图像与临床报告;每个病例提供浅层 OCT、深层 OCT、浅层 OCTA、深层 OCTA 以及图像级标签。按患者级别随机划分后,训练集包含 374 例正常样本,测试集包含 1,436 例正常与 2,981 例异常样本。第二个是公共 OCTA500-3MM 设置,从 OCTA500 数据集中抽取 3-mm 子集,组织为 OCT ILM-OPL、OCT OPL-BM、OCTA ILM-OPL、OCTA OPL-BM 四个输入;由于该数据没有配对临床报告,所有正常训练样本共享一份由 GPT 生成的固定正常报告,作为公共语义参考。评价指标为图像级 AUROC(I-AUROC)与图像级 Average Precision(I-AP),所有实验重复 5 个随机种子并报告均值 ± 标准差。

4.2 主要结果表格解读

表 1 汇总了主要对比结果。在私有数据集上,ReMoE 达到 I-AUROC 0.8682 与 I-AP 0.9358,比最强的四输入纯视觉基线 AnyAD 分别高出 8.82 与 4.33 个百分点;在 OCTA500-3MM 上,ReMoE 的 I-AUROC 与 I-AP 分别为 0.8995 与 0.9130,领先 AnyAD 4.06 与 2.32 个百分点。双输入变体 ReMoE-2I 也一致优于双输入多模态基线 MMRAD 与 TRMUAD,甚至与部分四输入纯视觉方法相当。这说明报告先验确实能够在差异计算前组织共享表示,使成对的结构与血管线索得到更有效的利用。

表 1:与现有方法在私有和公共 OCT/OCTA 设置上的对比。

CategoryMethodInputsProtocolPrivate I-AUROCPrivate I-APOCTA500 I-AUROCOCTA500 I-AP
Visual only unimodalMSFlow1Avg. 4 inputs0.65320.79690.84320.8568
Visual only unimodalURD1Avg. 4 inputs0.67730.80910.84520.8454
Visual only unimodalDinomaly1Avg. 4 inputs0.71750.85110.82420.8302
Visual only unimodalRD4AD1Avg. 4 inputs0.69030.77460.82220.8316
Visual only unimodalPatchCore1Avg. 4 inputs0.67760.73240.69730.7367
Visual only unimodalSimpleNet1Avg. 4 inputs0.72580.83860.79010.8142
Visual only multimodalMMRAD2Avg. 2 pairs0.57050.73920.64540.7007
Visual only multimodalTRMUAD2Avg. 2 pairs0.70160.82360.85190.8602
Visual only multimodalAnyAD4All 4 inputs0.78000.89250.85890.8898
Visual only multimodalUniMMAD4All 4 inputs0.70150.83300.80240.8258
OursReMoE-2I2Avg. 2 pairs0.79940.89080.86120.8792
OursReMoE4All 4 inputs0.86820.93580.89950.9130

4.3 消融实验与数值深度解读

消融实验(表 2)进一步揭示了各组件的贡献。以四输入 DINOv2 编码器-解码器差异模型为基线(0.7666 / 0.8831),仅加入视觉特征驱动的 RMM 只能带来约 0.66 pp AUROC 与 0.55 pp AP 的提升;而引入模态锚点后的 Anchor-only RMM 提升至 0.7801 / 0.8937,说明模态/slab 的语义描述本身就有组织共享表示的作用。随机文本先验与打乱报告先验均低于固定报告先验,证明提升并非来自任意文本条件,而是来自有意义的正常报告语义。进一步引入图像条件化的学生先验后,性能跃升至 0.8233 / 0.9074;完整的 ReMoE 再叠加模态锚点分支,达到 0.8682 / 0.9358。这一梯度清楚地说明:固定报告提供稳定的正常语义参考,学生先验提供样本自适应能力,二者互补。

表 2:私有数据集上的组件消融。

VariantPrior Stu.RMMAnc.I-AUROCI-AP
Baseline0.76660.8831
+ Visual only RMM0.77320.8886
+ Anchor only RMM0.78010.8937
+ Random text priorRand.0.77640.8901
+ Shuffled report priorShuf.0.79180.8996
+ Fixed report priorFix.0.80070.9035
+ Student only RMMRep.0.82330.9074
ReMoERep.0.86820.9358

表 3 比较了 RMM 内部不同路由聚合策略。Confidence routing 根据预测响应强度加权(0.8457 / 0.9236),Learned routing 使用可学习融合权重(0.8531 / 0.9277),Response fusion 先独立计算各模态/slab 的专家混合再通过拼接投影融合(0.8602 / 0.9316),而 Response mean 直接平均各条件响应(0.8682 / 0.9358)。直接平均取得了最好结果,说明在专家响应层面做简单聚合比引入额外的置信度或学习融合更有效,也暗示路由权重本身已经携带了足够的模态条件信息。

表 3:RMM 路由策略消融。

StrategyI-AUROCI-AP
Confidence routing0.8457 ± 0.00310.9236 ± 0.0024
Learned routing0.8531 ± 0.00240.9277 ± 0.0019
Response fusion0.8602 ± 0.00220.9316 ± 0.0017
Response mean0.8682 ± 0.00330.9358 ± 0.0020

表 4 的模态组合分析显示,单输入中深层 OCTA 在 I-AUROC 上最高(0.7872),深层 OCT 次之(0.7822),而 I-AP 更偏向深层 OCT(0.9006)与浅层 OCTA(0.8971),说明不同模态/slab 捕获的正常性线索具有指标依赖性。随着输入增加,平均双输入组合达到 0.7994 / 0.8908,平均三输入达到 0.8195 / 0.9062,四输入全模态达到 0.8682 / 0.9358。这一单调提升趋势说明 ReMoE 能够把更完整的多模态视觉证据与报告语义匹配起来,从而逐步细化正常性表征。表 5 还验证了学习缩放参数 αq\alpha^qαq 初始化为 0 时性能最佳,因为它在训练初期抑制图像条件分量,随后通过联合优化逐步放开。

表 4:模态组合分析。

Modalities#InputsI-AUROCI-AP
OCT-S10.74310.8725
OCT-D10.78220.9006
OCTA-S10.77090.8971
OCTA-D10.78720.8761
Avg. OCT/OCTA pairs20.79940.8908
Avg. 3 inputs30.81950.9062
All inputs40.86820.9358

表 5:图像条件语义缩放参数初始化消融。

Scale initI-AUROCI-AP
00.8682 ± 0.00330.9358 ± 0.0020
0.10.8526 ± 0.00880.9271 ± 0.0050
0.20.8573 ± 0.00710.9298 ± 0.0043
0.50.8624 ± 0.00380.9325 ± 0.0026
1.00.8580 ± 0.00380.9296 ± 0.0029

image-20260811081235985

图 3 展示了私有数据集上的定性异常图对比。从左到右依次为原图、MSFlow、URD、Dinomaly、MMRAD、TRMUAD、AnyAD、UniMMAD、ReMoE-2I、ReMoE 与 Ground Truth(由眼科医生根据临床报告标注的红色方框异常区域)。可以观察到,MSFlow 与 URD 的响应较为弥散,背景激活多;Dinomaly 的响应较清晰但有时会偏离真实异常位置;MMRAD 出现异常集中但定位不够精确的强亮点;AnyAD 与 UniMMAD 有所改善,但仍存在背景噪声。相比之下,ReMoE 的异常响应更集中在报告描述的红色方框区域,热图的空间连贯性更强,背景抑制更好;ReMoE-2I 已经展现出这一趋势,而使用全部四个输入的 ReMoE 进一步增强了响应强度与定位一致性。这一可视化与定量结果相互印证:报告先验帮助模型把差异计算聚焦到语义相关的解剖区域,而不是被全局纹理变化牵引。

image-20260811081300777

图 4 分析了图像级评分时使用的 top-pixel 比例 ρ\rhoρ 的敏感性。横轴为 ρ\rhoρ,纵轴为性能;蓝色实线表示 I-AUROC,橙色虚线表示 I-AP。当 ρ\rhoρ 取 0.005 与 0.010 时,两条曲线都维持在较高水平,且在 ρ=0.010\rho=0.010ρ=0.010 处达到最佳。继续增大到 0.020 与 0.050 后,I-AUROC 与 I-AP 均出现下降。这一趋势说明:图像级异常分数应基于少数高响应像素(约前 1%)计算,因为异常通常是局部的;若把大量低响应像素纳入平均,反而会稀释局部异常证据,降低判别力。该图也暗示 ReMoE 对 ρ\rhoρ 在小范围内并不敏感,工程上选择 0.01 是稳健的。

4.4 对比实验解读

与竞争方法相比,ReMoE 在私有和公共设置上都取得了稳定领先。纯视觉单模态方法(MSFlow、URD、Dinomaly、RD4AD、PatchCore、SimpleNet)即使对四个单输入结果取平均,也显著落后于多模态方法,说明多模态信息本身具有价值。多模态基线中,MMRAD 表现较差,TRMUAD 表现中等,AnyAD 与 UniMMAD 相对较强,但仍不及 ReMoE。ReMoE 的优势主要来源于报告语义先验对差异计算的指导,而不是更复杂的网络结构或更多的可训练参数。值得注意的是,ReMoE-2I 用两个输入就能逼近 AnyAD 四输入的表现,这对于临床场景中模态采集受限的情况具有实际意义。


五、批判性分析:优势、局限与改进方向

5.1 核心优势

✓ 把报告语义嵌入差异计算,提升异常分数的临床可解释性。 ReMoE 的核心优势在于让异常分数不再只是“看起来不一样”,而是“与报告描述的正常语义不一致”。这种语义感知差异在多模态医学影像中尤为重要,因为不同模态的正常解剖语义可以通过文本先验统一起来。

✓ 学生先验与模态锚点的互补设计。 图像条件化的学生先验提供样本自适应能力,模态锚点则提供稳定的模态/slab 方向,二者结合既避免了对固定文本的过拟合,又防止了学生预测在训练分布外完全失效。消融实验明确证明了这一互补性。

✓ 模块化且兼容现有编码器-解码器框架。 RMM 作为可插拔模块,可以嵌入到 Dinomaly、RD4AD 等编码器-解码器异常检测器中,不需要重新设计整个主干。这种“先验蒸馏 + 特征调制”的范式具有较好的迁移潜力。

5.2 局限性分析

** 对报告质量与可获取性的依赖。** 私有数据集依赖配对的临床报告,而 OCTA500-3MM 只能用 GPT 生成的固定报告。若报告质量差、术语不统一或完全缺失,ReMoE 的优势会大打折扣。如何将方法扩展到只有图像、没有报告的场景仍是一个开放问题。

模态锚点文本需要人工设计。 每种模态的文本描述 umu_mum 由作者手工指定(如“superficial OCT”“deep OCTA”)。在模态更多、命名更复杂的场景(如多序列 MRI、多器官超声)中,设计统一且临床准确的锚点文本会增加人工成本,也可能引入主观偏差。

缺少像素级定位指标与细粒度分析。 论文仅报告了图像级 I-AUROC 与 I-AP,没有提供像素级 AUROC(P-AUROC)或 PRO 等定位指标。虽然图 3 的定性图显示定位效果不错,但缺乏像素级定量证据限制了对其异常定位能力的全面评估。

评估范围局限于视网膜 OCT/OCTA。 作者在结论中也承认,当前验证集中在视网膜 OCT/OCTA。该方法在其他解剖部位、其他模态组合(如 PET/CT、MRI 多序列、病理-影像)以及不同报告风格下的泛化能力尚待验证。

5.3 与竞争性方法的深度对比

与 AnyAD 相比,ReMoE 不强调“任意模态组合输入”,而是强调“如何用文本先验把可用模态组织得更好”;因此两者的适用场景不同:AnyAD 更适合模态采集不固定的场景,ReMoE 更适合有配对报告且希望提升异常语义一致性的场景。与 UF-MADS 相比,ReMoE 通过蒸馏把报告转化为图像条件伪文本,而不是依赖预定义提示模板,因此在报告风格变化时可能更具适应性,但也更依赖训练数据。与 Dinomaly 等纯视觉方法相比,ReMoE 增加了文本编码器与学生网络的计算开销,但在多模态语义丰富的医学数据上收益明显。

5.4 工程实践中的注意事项

工程部署时需要注意几点。第一,CLIP 文本编码器与 DINOv2-R 视觉编码器都是冻结的,但推理时仍需加载 CLIP 文本编码器与学生网络,显存与延迟会高于纯视觉方法。第二,报告文本需要规范化处理:过长报告可能需要截断或摘要,不同医生书写风格差异大时蒸馏目标会不稳定。第三,模态锚点文本与超参数(λRSD=0.15\lambda_{\text{RSD}}=0.15λRSD=0.15ρ=0.01\rho=0.01ρ=0.01K=3K=3K=3αq\alpha^qαq 初始化 0)在新数据集上建议做网格搜索。第四,由于学生参数在同一网络侧共享,学生容量不能过小,否则无法有效拟合报告语义。


六、历史影响与演进

  • 1991:Huang 等人发明 OCT,为后续视网膜结构成像奠定基础。
  • 2021:CLIP 发布,Radford 等人证明自然语言监督可学习可迁移视觉模型;同年学生-教师特征金字塔匹配等视觉异常检测方法兴起。
  • 2022:RD4AD、DRAEM、PaDiM/PatchCore 等视觉异常检测方法成熟;GLoRIA、ConVIRT 等医学视觉-语言预训练显示文本可提升医学表示。
  • 2024:DINOv2-R 引入寄存器机制提升 ViT 特征;OCTA-500 等公共视网膜数据集发布,推动多模态眼科 AI。
  • 2025:Dinomaly 利用 DINOv2 特征做多类别异常检测;AnyAD、UniMMAD 开始关注任意模态组合与统一多模态异常检测。
  • 2026:ReMoE 与 UF-MADS 等尝试把临床文本/报告语义引入异常检测,标志医学异常检测从“视觉中心”走向“语义-视觉对齐”。

6.1 可复用的工程经验

从工程角度看,ReMoE 提供了一条可复用的思路:把“高层语义先验”蒸馏成“低维条件向量”,再通过条件化特征调制改变异常检测的几何。这条思路不仅适用于报告文本,也可以迁移到临床标签、解剖图谱、甚至生成式模型的隐空间先验。关键经验是:先验应该作用于差异计算之前,而不是仅仅用于后处理;同时,先验需要与模态条件显式结合,才能在海量多模态数据上稳定生效。


七、一句话总结

核心贡献: ReMoE 提出了一种报告引导的混合专家框架,通过把正常报告语义蒸馏成图像条件的伪文本先验,并结合模态锚点构建模态感知先验,进而利用 RMM 在编码器-解码器差异计算前调制多模态视觉特征,使异常分数能够反映“报告语义指引下的语义感知差异”。

关键公式记忆: tb=Norm(ftext(rb))t_b = \mathrm{Norm}(f_{\text{text}}(r_b))tb=Norm(ftext(rb))(报告嵌入)、pb,l,mq=pmq,anc+tanh⁡(αq)γb,l,mqpb,l,mq,stup^q_{b,l,m} = p^{q,\text{anc}}_m + \tanh(\alpha^q)\gamma^q_{b,l,m}p^{q,\text{stu}}_{b,l,m}pb,l,mq=pmq,anc+tanh(αq)γb,l,mqpb,l,mq,stu(模态感知先验)、V~b,lq=ηlq(Hb,lq+Ub,lq)\widetilde{V}^q_{b,l}=\eta^q_l(H^q_{b,l}+U^q_{b,l})Vb,lq=ηlq(Hb,lq+Ub,lq)(RMM 调制特征)、s(X)=1∣Ωρ∣∑(i,j)∈ΩρA(i,j)s(X)=\frac{1}{|\Omega_\rho|}\sum_{(i,j)\in\Omega_\rho}A(i,j)s(X)=Ωρ1(i,j)ΩρA(i,j)(top-ρ\rhoρ 图像级异常分数)。

未来研究方向预测

未来可以在三个方向延伸:一是把 ReMoE 扩展到更广泛的模态组合(如 PET/CT、MRI 多序列、病理-放射组学),验证其跨病种泛化能力;二是用大型医学语言模型自动生成或精炼模态锚点文本,减少人工设计;三是把报告先验与像素级监督结合,开发能够同时给出异常分数与报告级解释的可解释异常检测系统。

更多推荐