论文基本信息

Paper: Large Brain Model for Learning Generic Representations with Tremendous EEG Data in BCI
Institution: Shanghai Jiao Tong University
Publication: International Conference on Learning Representations
Year: 2024
Code: Open Source Code

在这里插入图片描述

1 摘要

论文针对当前脑电(EEG)深度学习模型普遍面向特定数据集与任务定制、模型规模受限、感知能力与泛化性不足的核心问题,提出名为LaBraM的大规模EEG基础模型框架。该模型借鉴大语言模型的自监督预训练思路,通过将EEG信号切分为通道补丁(channel patch)解决不同数据集通道数、时长异构的问题;设计向量量化神经频谱预测任务训练语义丰富的神经Tokenizer,将连续EEG信号编码为离散神经码;再通过掩码EEG建模任务预训练神经Transformer,学习通用EEG信号表示。研究团队聚合约20个数据集、总计超2500小时的多范式EEG数据完成预训练,并在异常检测、事件类型分类、情绪识别、步态预测四类差异化下游任务上进行微调验证。实验结果表明,LaBraM在各任务上均大幅超越同期SOTA方法,且模型性能随数据量与参数量提升呈现明显的缩放规律,验证了大规模无标注EEG数据预训练的可行性与有效性,为脑电大模型的发展奠定了基础。

2 背景

深度神经网络在BCI与EEG信号分析中具备自动提取特征的潜力,但EEG数据采集成本高、标注依赖专业专家,导致特定任务的标注数据集规模普遍很小,难以支撑大模型训练。同时,不同采集设备的电极数量、采样率、数据长度、任务范式差异巨大,信号信噪比低、噪声复杂,使得现有模型大多针对单一任务设计,参数规模受限,跨任务、跨被试、跨设备的泛化能力薄弱。

近年来,大语言模型(LLM)通过自监督预训练在海量文本上学习通用表示的范式取得了巨大成功,启发研究者探索大规模EEG模型(Large EEG Models, LEMs):通过无监督预训练从海量无标注EEG中学习通用感知能力,再针对不同下游任务微调。但直接将LLM的预训练范式迁移到EEG领域面临三大核心挑战:

  1. 数据量匮乏:不存在单一大规模EEG数据集足以支撑大模型训练,且标注成本极高;
  2. 采集配置异构:电极数量、采样参数、数据格式不统一,无法直接匹配Transformer的输入格式;
  3. 表示学习范式缺失:EEG信噪比低、时空特性复杂,现有CNN/RNN/GNN范式难以同时高效捕捉时空语义特征。

3 贡献

设计一个通用的大型EEG模型,该模型可以有效地处理不同通道和长度的EEG数据集。通过在大量EEG数据上进行无监督训练,使该模型具有通用的EEG数据理解能力,使其能够快速适应各种EEG下游任务。

  1. 首次实现大规模EEG预训练:聚合约20个公开与自采集数据集,构建了总计超2500小时的多范式EEG预训练语料,是当时BCI领域规模最大的预训练数据集与模型。
  2. 兼容异构EEG配置:通过通道补丁切分+可学习时空嵌入的设计,使单一预训练模型可适配任意通道数、任意时长的EEG输入,无需针对下游数据集修改模型结构。
  3. 高效的EEG表示学习范式:提出向量量化神经频谱预测训练神经Tokenizer,构建具有语义的神经码本;结合神经Transformer同时捕捉EEG的时空特征,通过掩码EEG建模完成自监督预训练。
  4. 全面的下游任务验证:在异常检测、事件分类、情绪识别、步态预测四类差异化任务上验证了模型的泛化能力,全面超越同期SOTA方法;并通过缩放实验揭示了EEG大模型的性能增长规律。

4 方法

4.1 数据集

4.1.1 预训练数据集

预训练共使用16个EEG数据集,总时长2534.78小时,数据来源包括公开临床数据集、公开BCI范式数据集与团队自采集数据,涵盖癫痫检测、运动想象、情绪认知、静息态、P300等多种任务范式,电极数量从19通道到64通道不等,采样率覆盖100Hz~2048Hz,保证了预训练数据的多样性与通用性。

典型数据集包括:TUSZ癫痫数据集(1138.53小时)、TUEP癫痫对照数据集(591.22小时)、SEED系列情绪数据集(166.75小时)、运动想象数据集、静息态数据集等。所有下游任务数据集均被排除在预训练语料之外,保证评估公平性。

4.1.2 下游数据集

选取4类完全不同的下游任务验证模型泛化能力,覆盖二分类、多分类、回归三类任务形式:

表1 下游数据集统计
数据集任务类型采样率通道数任务目标样本形式
TUAB异常检测256Hz23二分类:正常/异常EEG10秒样本,共409455条
TUEV事件分类256Hz23六分类:尖波、痫样放电、眼动、伪迹等5秒样本,共112491条
SEED-V情绪识别1000Hz62五分类:喜、悲、中性、厌恶、恐惧1秒样本,共148080条
MoBI步态预测100Hz60回归:预测下肢髋/膝/踝12个关节角度2秒样本,共575830条

4.2 预处理

仅采用最少的必要预处理步骤,最大程度保留原始信号信息:

  1. 带通滤波:0.1Hz~75Hz带通滤波去除低频漂移与高频噪声;
  2. 陷波滤波:50Hz陷波去除工频干扰;
  3. 重采样:统一重采样至200Hz;
  4. 幅值归一化:以0.1mV为单位缩放,将信号幅值主要控制在[-1,1]区间。

4.3 模型架构

LaBraM整体为神经Transformer架构,核心设计围绕“适配异构EEG输入”与“高效时空特征学习”展开,整体流程为:通道补丁切分→时域编码→时空嵌入注入→Transformer编码器。LaBraM的整体架构图如图1所示。

在这里插入图片描述

图1 LaBraM的整体架构图
  1. 通道补丁切分
    以固定长度的时间窗口(默认200个采样点,即1秒)无重叠地对每个EEG通道进行切分,得到一个个“通道-时间”补丁。该设计将任意通道数、任意时长的EEG统一转化为补丁序列,天然适配不同采集配置的数据集,是模型兼容异构输入的核心。
  2. 时域编码器(Temporal Encoder)
    由多个一维卷积块堆叠而成,每个卷积块包含1D卷积、组归一化(Group Norm)与GELU激活函数。针对每个补丁独立提取时域特征,将一维信号补丁映射为固定维度的补丁嵌入,为后续注意力交互提供高质量的时域特征基础。
  3. 时空嵌入(Temporal & Spatial Embedding)
    初始化两组可学习的嵌入向量:
    • 时间嵌入:对应补丁在时间维度的位置,为模型提供时序位置信息;
    • 空间嵌入:对应国际10-20系统的全量电极位置,每个电极对应唯一的空间嵌入。
      将对应位置的时间嵌入与空间嵌入叠加到补丁嵌入上,作为绝对位置编码,使模型感知补丁的时空位置,同时天然支持不同通道子集的输入。
  4. Transformer 编码器
    采用标准Transformer结构并做针对性优化:
    • 在点积注意力前对Q、K分别做层归一化,避免注意力logits数值过大,提升训练稳定性;
    • 移除QKV计算中的偏置项,在不损失性能的前提下加速训练;
    • 下游任务时,对输出嵌入做平均池化后接入任务专属预测头。

4.4 训练与评估

整体训练概述图如图2所示,分为神经Tokenizer训练LaBraM预训练两个阶段,下游任务基于预训练权重做微调。

在这里插入图片描述

图2 神经Tokenizer训练(上半部分)和LaBraM预训练(下半部分)

4.4.1 神经Tokenizer训练

受VQ-VAE与BEiT启发,提出向量量化神经频谱预测训练神经Tokenizer,目标是将连续EEG补丁转化为离散、有语义的神经令牌,为掩码预训练提供预测目标。

  1. 神经码本:定义包含K个离散向量的码本,每个补丁特征会被量化为码本中最相似的向量(采用L2归一化后计算余弦相似度匹配),提升码本利用率。
  2. 傅里叶频谱预测目标:由于EEG信噪比低、随机性强,直接重建原始信号损失难以收敛。因此改为预测EEG补丁的傅里叶频谱(幅度+相位),通过MSE损失指导Tokenizer与解码器训练。频谱特征更能反映大脑神经活动的本质规律,训练更稳定且语义性更强。
  3. 训练策略:采用EMA(指数移动平均)更新码本,总损失包含频谱重建损失与量化损失两部分。

4.4.2 LaBraM预训练

采用掩码EEG建模作为预训练任务,类比BERT的掩码语言建模:

  1. 随机按比例掩码部分EEG补丁,替换为可学习的掩码向量;
  2. Transformer基于可见补丁的上下文,预测被掩码补丁对应的神经令牌(码本索引);
  3. 采用交叉熵损失优化模型,让模型学习EEG的时空上下文依赖与通用模式。

同时提出对称掩码策略提升训练效率与效果:对同一条样本,同时使用原掩码与反掩码做两次预测,复用Tokenizer的离散表示,在不增加额外前向开销的前提下增加数据多样性,显著提升下游任务性能。

4.4.3 下游微调

设置三种模型尺寸:LaBraM-Base(5.8M)、LaBraM-Large(46M)、LaBraM-Huge(369M)。微调时根据任务类型选择对应损失函数:二分类用BCE损失,多分类用交叉熵损失,回归用MSE损失。同时探索了全微调、部分层微调、线性探测等多种迁移方式。

5 结果

5.1 预训练收敛特性

在这里插入图片描述

图3 预训练损失曲线和掩码预测准确率曲线

预训练过程中,模型规模越大,最终收敛的预训练损失越低、掩码预测准确率越高。其中369M的Huge模型在50轮训练后仍保持明显的性能上升趋势,验证了扩大模型规模对EEG表示学习的正向增益,符合大模型的缩放规律。

5.2 下游任务SOTA对比

在四个下游任务上,LaBraM均全面超越同期SOTA方法(包括BIOT、ST-Transformer、SPaRCNet等),且模型越大性能提升越显著:

  1. TUAB异常检测:LaBraM-Base的平衡准确率达0.8140,AUROC达0.9022;Huge模型进一步提升至0.8258与0.9162,领先BIOT等基线模型显著幅度。
  2. TUEV事件分类:提升幅度最为突出,Base模型平衡准确率达0.6409,Cohen’s Kappa达0.6637,远高于基线BIOT的0.5281与0.5273,证明预训练学到的语义表示对高难度事件分类增益巨大。
  3. SEED-V情绪识别:Base模型准确率达0.4095,同样领先所有基线方法。
  4. MoBI步态预测:Large与Huge模型在皮尔逊相关系数、R2分数上均达到最优,Base模型也与最佳基线持平。

在这里插入图片描述

图4 预训练有/没有下游数据集

图4实验验证,是否将下游数据集加入预训练,对最终微调性能无显著影响,证明模型确实学到了通用的EEG表示,而非对特定数据的过拟合。

5.3 缩放定律与数据量分析

通过控制预训练数据量(1h/5h/10h/500h/1000h/1500h/2000h/2500h)对比不同尺寸模型的性能,结果如图5所示,得到关键结论:

在这里插入图片描述

图5 缩放定律与数据量分析
  1. 小模型(Base)在500小时数据下性能就接近饱和,继续增加数据增益有限;
  2. 中等模型(Large)随数据量增长性能稳步提升,1000小时后增速放缓;
  3. 大模型(Huge)性能随数据量持续上升,2500小时仍未达瓶颈,推测需要万小时级数据才能充分释放大模型潜力。

该结果验证了EEG领域同样存在缩放定律,为后续更大规模脑电大模型的研发提供了数据量参考。

5.4 消融实验

论文通过多组消融实验验证了模型各核心组件与训练策略的有效性,所有实验均基于LaBraM-Base在TUAB与TUEV数据集上完成。

5.4.1 向量量化神经频谱预测的有效性

为验证基于码本的离散令牌化对预训练的价值,设置了三组对照实验与完整LaBraM对比:

  • Setting 1:直接预测神经Tokenizer的输出嵌入(余弦相似度匹配),不使用离散码本;
  • Setting 2:丢弃神经Tokenizer,直接以MSE损失重建原始EEG补丁;
  • Setting 3:丢弃神经Tokenizer,直接以MSE损失重建EEG补丁的傅里叶频谱。
表2 向量量化神经频谱预测的有效性

在这里插入图片描述

实验结果显示:

  1. 完整LaBraM在高难度的TUEV事件分类任务上取得最优性能(平衡准确率0.6409),显著优于三种对照设置,证明离散神经码本学习到的语义表示对高层级下游任务增益显著。
  2. 直接重建原始信号/频谱的设置(Setting 2/3)在低层级的TUAB异常检测任务上表现略好,但在复杂语义分类任务上性能下滑明显。论文解释为:异常检测属于低层级视觉可分任务,简单重建即可学习有效特征;而事件类型分类需要高层语义理解,依赖码本学习到的抽象神经表征。

5.4.2 掩码比例的影响

针对掩码EEG建模的掩码比例进行消融,结合对称掩码策略,验证了0.1~0.5共5组比例的效果:

表3 掩码比例的影响

在这里插入图片描述

  1. TUAB任务的最优掩码比例为0.4(对称侧0.6),TUEV任务的最优比例为0.5(对称侧0.5);
  2. 0.5的掩码比例在两个任务上均取得了次优性能,且在所有比例中标准差最小,模型稳定性最佳;
  3. 综合性能与泛化稳定性,论文最终选择0.5作为默认掩码比例。

5.4.3 对称掩码策略的增益

对比有无对称掩码(Symmetric masking,SM)的性能差异,核心结论如下:

表4 对称掩码策略的增益

在这里插入图片描述

  1. 对于Base级小模型,对称掩码在TUAB上增益微弱,甚至略有持平,原因是小模型容量有限,数据量已足够支撑训练;
  2. 对于Large与Huge级大模型,移除对称掩码后TUEV任务性能出现大幅下滑(Huge模型平衡准确率从0.6616降至0.6261),证明对称掩码通过复用离散表示、增加数据多样性,能有效满足大模型的数据需求,同时提升模型鲁棒性。

5.4.4 预训练的必要性验证

将模型直接在下游数据集上从头训练(无预训练),与完整预训练+微调的结果对比:

在这里插入图片描述

图6 预训练的必要性验证
  1. 两个任务的各项指标均出现断崖式下跌,TUEV任务的性能衰退幅度远大于TUAB;
  2. 该结果直接证明了掩码EEG预训练的核心价值:自监督学习到的通用表示能大幅提升下游任务性能,尤其对复杂语义任务增益更显著。

5.4.5 微调策略的影响

对比了全量微调、微调不同层数Transformer、线性探测五种微调方式:

表5 微调策略的影响

在这里插入图片描述

  1. TUAB任务:全量微调、微调全部12层、微调最后8层的性能几乎一致,仅微调最后4层与线性探测有轻微下降;
  2. TUEV任务:微调最后8层Transformer取得了最优性能(平衡准确率0.6611,Cohen’s Kappa0.6820),优于全量微调;线性探测的性能则出现大幅滑坡,证明高层特征需要少量微调适配任务,而底层通用特征可直接复用。

5.4.6 空间嵌入的作用

移除空间嵌入后进行测试:

表6 空间嵌入的作用

在这里插入图片描述

  1. 预训练阶段损失无法收敛,模型无法定位被掩码的补丁位置;
  2. 下游微调阶段,两个任务的各项指标均出现显著下降,TUAB的AUROC从0.9022降至0.8888,TUEV的Cohen’s Kappa从0.6637降至0.6069;
  3. 证明可学习的空间嵌入是模型捕捉电极空间信息、适配异构通道配置的核心组件,对预训练与下游性能均至关重要。

6 讨论

6.1 局限性

  1. 规模仍有差距:尽管已是当时BCI领域最大的模型与数据集,但2500小时数据、369M参数相比CV与NLP领域的大模型仍有数量级差距,仅验证了脑电大模型的可行性,尚未探索涌现能力。
  2. 微调成本较高:当前依赖全量微调适配下游任务,计算与内存开销较大,不利于小样本场景与边缘部署。
  3. 单模态限制:仅使用EEG单模态数据预训练,尚未融合语言、影像、其他生理信号等多模态信息。

6.2 未来工作

  1. 规模拓展:收集更多范式、更大体量的EEG数据,训练参数量更大的模型,探索EEG大模型是否存在类似LLM的涌现能力。
  2. 高效微调:引入适配器、Prompt Tuning、LoRA等参数高效微调方法,降低下游适配的计算与存储成本。
  3. 多模态融合:将图像、语言、其他生理信号纳入预训练框架,探索EEG与自然语言的语义对齐,构建多模态脑信号大模型。

7 总结

LaBraM是脑电大模型发展中具有里程碑意义的工作,它首次系统性验证了“海量无标注EEG+自监督预训练+大模型”范式在脑电领域的可行性。通过通道补丁切分与神经频谱Tokenizer,巧妙解决了EEG数据异构、信噪比低的行业痛点,实现了单一模型跨通道、跨时长、跨任务的通用表示学习。

与BENDR等早期探索相比,LaBraM在预训练数据规模、模型尺寸、任务覆盖广度、性能提升幅度上都实现了跨越式发展,正式将脑电研究带入基础模型时代,为后续EEG大模型的算法设计、数据构建、落地应用提供了完整的范式参考。

更多推荐