论文基本信息

Paper: Large Brain Model for Learning Generic Representations with Tremendous EEG Data in BCI
Institution: Harbin Institute of Technology
Publication: Neural Information Processing Systems
Year: 2024
Code: Open Source Code

在这里插入图片描述

1 摘要

论文针对脑电(EEG)信号信噪比低、被试间差异大、通道配置不匹配,导致鲁棒通用的特征提取困难的问题,提出了名为EEGPT的预训练Transformer模型,参数量超千万级,面向通用EEG特征提取任务。该模型设计了基于掩码的双自监督学习方法,在传统掩码重建的基础上引入时空表征对齐:以高信噪比、富含语义的EEG表征为自监督目标,而非原始信号,缓解了低信噪比下特征提取质量差的问题。同时模型采用分层结构,分别对空间与时间信息进行解耦处理,在降低计算复杂度的同时,提升了BCI场景下的灵活性与适配性。实验验证,在线性探测(linear-probing)设定下,模型在运动想象、事件相关电位检测、睡眠分期等多种下游任务上均达到SOTA性能,验证了方法的有效性与可扩展性,为脑电表示学习与生物信号处理提供了新的解决方案。

2 背景

脑电图(EEG)通过记录大脑皮层电信号动态反映脑功能状态,在医学、神经科学与脑机接口(BCI)领域具有核心价值,但其自身特性带来了诸多应用挑战:

  1. 信噪比(SNR)极低:脑电信号微弱,易受噪声干扰,传统方法难以提取稳定的抽象特征;
  2. 被试间差异显著:不同个体的脑电模式差异大,跨被试泛化难度高;
  3. 通道与采样率异构:不同采集设备的电极数量、位置、采样率不一致,模型通用性受限;
  4. 任务依赖性显著:脑电信号与任务类型相绑定,跨任务泛化难度高,模型通用性受限。

自监督学习在NLP、CV、语音领域已验证了强大的通用表征能力,通过大规模无标注数据预训练+下游微调的范式,可大幅降低对标注数据的依赖。其中掩码自编码器(MAE)通过恢复被掩码的输入片段学习特征,在BERT、MAE等工作中取得了巨大成功。

近年来,EEG领域也涌现出一批自监督预训练工作,但仍存在明显局限:

  1. BENDR:结合卷积编码器与Transformer,融合掩码重建与对比学习,但以原始信号为重建目标,低信噪比下特征质量受限;
  2. EEG2VEC:基于对比损失和重建损失学习EEG表征的自监督模型,预训练好的模型作为下游任务的特征提取器;
  3. BIOT:针对多生物信号跨数据学习设计,采用分通道token化,但对时域精细特征建模不足,在ERP类任务上表现受限;
  4. LaBraM:通过神经令牌化实现跨数据集学习,但对时空信息的解耦与利用仍有提升空间。

整体而言,现有通用EEG模型在低信噪比信号的特征质量、跨设备通道适配性、多范式任务通用性上仍有不足,亟需更高效的预训练框架。

3 贡献

提出了一种基于EEG信号时空一致性的双自监督EEG通用表示方法EEGPT(EEG Pretrained Transformer)进行高效的特征提取,包括时空表示对齐和基于掩膜的重建,增强了表示质量和模型鲁棒性。

  1. 提出通用EEG预训练模型EEGPT:构建了千万级参数量的Transformer架构,通过多范式混合数据集预训练,显著提升了跨任务、跨被试的特征泛化能力。
  2. 设计双自监督预训练方法:融合时空表征对齐掩码重建两个自监督任务,以高信噪比的完整信号表征为对齐目标,提升了编码特征的语义丰富度与模型收敛效率。
  3. 分层时空解耦架构:先从短时EEG中提取稳定空间表征,再建模长时时序关联,既降低了计算复杂度,也增强了模型在不同BCI场景下的灵活性与适配性。
  4. 局部时空嵌入与通道自适应:设计可学习通道嵌入词典(Codex book),灵活适配不同采集设备的通道配置,提升了模型在异构数据上的鲁棒性。
  5. 系统性实验验证:在7个下游数据集、多种EEG范式上全面超越现有通用模型,验证了模型缩放定律——参数量与预训练数据量越大,下游性能持续提升。

4 方法

4.1 数据集

4.1.1 预训练数据集

选取5种不同范式的公开EEG数据集构建混合预训练语料,覆盖运动想象、稳态视觉诱发电位、情绪识别、多范式生物特征等场景:

表1 预训练数据集统计
数据集范式被试数类别数
PhysioMI运动想象/运动执行1095
HGD运动想象144
TSU稳态视觉诱发电位(SSVEP)3540
SEED情绪分类153
M3CV多范式(静息、ERP、P300等)106-

4.1.2 下游数据集

选取7个主流下游任务数据集,全面验证模型的跨范式泛化能力:

表2 下游数据集统计
数据集范式被试数类别数
BCIC-2A运动想象(4类)104
BCIC-2B运动想象(2类)102
Sleep-EDFx睡眠分期1975
KaggleERN错误相关负波(ERN)362
PhysioP300P300事件相关电位92
TUAB脑电异常检测23832
TUEV脑电事件分类2886

4.2 预处理

所有数据集执行统一的基础预处理流程:

  1. 信号裁剪为4s时长片段;
  2. 采用全局平均参考进行重参考;
  3. 统一通道选择与幅值缩放(单位为mV);
  4. 重采样至统一采样率256Hz;
  5. 运动想象类下游任务额外添加0-38Hz带通滤波。

4.3 模型架构

EEGPT整体采用“分块-嵌入-掩码-编码-预测-重建”的层级结构,核心分为局部时空嵌入、编码器、预测器、动量编码器、重建器五大模块,整体结构如下图所示:

在这里插入图片描述

图1 EEGPT整体结构

4.3.1 局部时空嵌入

在这里插入图片描述

图2 局部时空嵌入示意图

首先将输入EEG信号(M个通道、T个时间点)在时空维度划分为互不重叠的patch:每个patch 对应单个通道的一段时长信号(时长64个采样点,约250ms)。

p i , j = x i ,   ( j − 1 ) d : j d p_{i,j} = x_{i,\, (j-1)d : jd} pi,j=xi,(j1)d:jd

对每个patch执行两步嵌入:

  1. 线性嵌入:通过一维卷积将patch的时域波形 p i , j p_{i,j} pi,j映射为固定维度特征向量;
  2. 通道嵌入:构建可学习的通道嵌入词典(Codex book),所用到的通道如图3所示,通过通道名称到嵌入向量的映射 ς i \varsigma_i ςi,将空间位置信息融入特征,灵活适配不同数据集的通道配置。
    t o k e n i , j = E m b e d ( p i , j ) + ς i token_{i,j} = \mathrm{Embed}(p_{i,j}) + \varsigma_i tokeni,j=Embed(pi,j)+ςi

最终每个patch对应一个token,同时保留通道与时间维度的结构信息。

在这里插入图片描述

图3 通道电极示意图

4.3.2 双自监督核心结构

预训练采用50%时间patch+80%通道patch的掩码策略,仅将掩码后的token输入编码器,通过双分支任务完成自监督学习。

  1. 编码器(Encoder)
    以同一时间片下所有掩码通道的token为输入,通过Transformer融合空间信息,输出该时间片的空间表征;同时引入可学习的summary token,聚合单时间片内的全局信息。
    e n c j = E N C ( { t o k e n i , j } ( i , j ) ∈ M ) enc_j = \mathrm{ENC}\left( \substack{\{ token_{i,j} \} \\ (i,j) \in \mathcal{M}} \right) encj=ENC({tokeni,j}(i,j)M)
  2. 预测器(Predictor)
    接收编码器输出的掩码时间片特征,结合旋转位置编码(RoPE)引入时序信息,通过可学习的query token预测出所有时间片的完整特征序列。该设计将空间编码与时序预测解耦,大幅降低了计算复杂度。
    { p r e d t } t ∈ { 1 , 2 , … , N } = P R E D ( { e n c j + p o s j } ∃ i , ( i , j ) ∈ M ) \{ pred_t \}_{\substack{t \in \{1,2,\dots,N\} }} = \mathrm{PRED}\left( \substack{ \{ enc_j + pos_j \} \\ \exists i,\, (i,j) \in \mathcal{M} } \right) {predt}t{1,2,,N}=PRED({encj+posj}i,(i,j)M)
  3. 动量编码器(Momentum Encoder)
    结构与编码器完全一致,输入完整的未掩码token,输出高质量的全局表征作为对齐目标;其参数通过编码器参数的动量更新(更新系数0.01)得到,避免训练过程中目标波动过大。
    m e n c j = M E N C ( { t o k e n i , j } ( i , j ) ∈ M ∪ M ‾ ) menc_j = \mathrm{MENC}\left( \substack{ \{ token_{i,j} \} \\ (i,j) \in \mathcal{M} \cup \overline{\mathcal{M}} } \right) mencj=MENC({tokeni,j}(i,j)MM)
  4. 重建器(Reconstructor)
    融合编码器的掩码特征与预测器的预测特征,通过跳跃连接保留底层细节,重建出未掩码区域的原始EEG patch。
    { r e c u , t } ( u , t ) ∈ M ‾ = R E C ( { e n c j + p o s j } ∃ i , ( i , j ) ∈ M ∪ { p r e d j + p o s j } ∀ i , ( i , j ) ∈ M ‾ ) \substack{ \{ rec_{u,t} \} \\ (u,t) \in \overline{\mathcal{M}} } = \mathrm{REC}\left( \substack{ \{ enc_j + pos_j \} \\ \exists i,\, (i,j) \in \mathcal{M} } \cup \substack{ \{ pred_j + pos_j \} \\ \forall i,\, (i,j) \in \overline{\mathcal{M}} } \right) {recu,t}(u,t)M=REC({encj+posj}i,(i,j)M{predj+posj}i,(i,j)M)

4.3.3 双自监督损失函数

总损失由对齐损失重建损失两部分构成,均采用均方误差(MSE)计算:

  1. 时空表示对齐损失:约束预测器输出的特征与动量编码器输出的完整信号特征对齐,迫使编码器提取富含语义、鲁棒的全局表征,提升特征质量;
    L A = − 1 N ∑ j = 1 N ∥ p r e d j ,   L N ( m e n c j ) ∥ 2 2 \mathcal{L}_A = -\frac{1}{N} \sum_{j=1}^{N} \left\| pred_j,\, \mathrm{LN}(menc_j) \right\|_2^2 LA=N1j=1Npredj,LN(mencj)22
  2. 掩码重建损失:约束重建patch与原始patch的波形一致,利用脑电信号的时空一致性补充细节特征;
    L R = − 1 ∣ M ‾ ∣ ∑ ( i , j ) ∈ M ‾ ∥ r e c i , j ,   L N ( p i , j ) ∥ 2 2 \mathcal{L}_R = -\frac{1}{|\overline{\mathcal{M}}|} \sum_{(i,j) \in \overline{\mathcal{M}}} \left\| rec_{i,j},\, \mathrm{LN}(p_{i,j}) \right\|_2^2 LR=M1(i,j)Mreci,j,LN(pi,j)22
  3. 总损失:完整的预训练损失 L \mathcal{L} L L A \mathcal{L}_A LA L R \mathcal{L}_R LR两部分求和构造而成。
    L = L A + L R \mathcal{L} = \mathcal{L}_A + \mathcal{L}_R L=LA+LR

4.3.4 下游线性探测(Linear-probing)

下游任务采用线性探测范式,如图4所示,冻结预训练编码器的全部参数,仅新增少量可训练模块:

在这里插入图片描述

图4 下游线性探测
  1. 自适应空间滤波:1×1卷积,用于对齐下游数据与预训练模型的通道差异;
  2. 线性分类头:将summary token输出的特征映射为类别logits。

该范式既大幅降低了下游训练的计算开销,也能更公平地验证预训练特征的质量,同时避免小样本下的过拟合问题。

4.4 训练与评估

4.4.1 预训练设置

  1. 模型变体:设计8种不同参数量的模型变体,验证缩放效应;最优大模型为8层Transformer、512维嵌入、4个summary token,参数量约1.01亿;
  2. 优化器:AdamW,采用OneCycle学习率策略(初始2.5e-4,峰值5e-4,最低3.13e-5);
  3. 训练轮次:200epoch,64batch size,16位混合精度训练;
  4. 硬件:8张NVIDIA 3090 GPU。

4.4.2 评估策略

  1. TUAB与TUEV数据集:严格遵循BIOT的实验配置与数据划分,保证公平对比;
  2. 其余下游任务:遵循BENDR的实验配置,采用留一被试交叉验证(LOSO);
  3. 所有实验重复3次,报告均值与标准差,确保结果可靠。

5 结果

5.1 下游实验结果

表3 不同方法在TUAB数据集上的结果
方法模型大小Balanced AccuracyAUROC
SPaRCNet0.79M0.7896±0.00180.8676±0.0012
ContraWR1.6M0.7746±0.00410.8456±0.0074
CNN-T3.2M0.7777±0.00220.8461±0.0013
FFCL2.4M0.7848±0.00380.8569±0.0051
ST-T3.5M0.7966±0.00230.8707±0.0019
BIOT3.2M0.7959±0.00570.8815±0.0043
Ours-Tiny4.7M0.7959±0.00210.8716±0.0041
Ours25M0.7983±0.00300.8718±0.0050
表4 不同方法在TUEV数据集上的结果
方法模型大小Balanced AccuracyWeighted F1Cohen’s Kappa
SPaRCNet0.79M0.4161±0.02620.7024±0.01040.4233±0.0181
ContraWR1.6M0.4384±0.03490.6893±0.01360.3912±0.0237
CNN-T3.2M0.4087±0.01610.6854±0.02930.3815±0.0134
FFCL2.4M0.3979±0.01040.6783±0.01200.3732±0.0188
ST-T3.5M0.3984±0.02280.6823±0.01900.3765±0.0306
BIOT3.2M0.5281±0.02250.7492±0.00820.5273±0.0249
Ours-Tiny4.7M0.5670±0.00660.7535±0.00970.5085±0.0173
Ours25M0.6232±0.01140.8187±0.00630.6351±0.0134

在临床EEG数据集TUAB与TUEV上与现有方法对比:

  1. TUAB(异常检测):EEGPT性能与BIOT相当,25M参数量版本平衡准确率达0.7983,AUROC达0.8718;
  2. TUEV(事件分类):EEGPT大幅领先,25M版本平衡准确率达0.6232,相比BIOT提升9.5%;加权F1达0.8187,相比BIOT提升6.9%。
表5 通用EEG模型在各种数据集上的结果

在这里插入图片描述

在运动想象、睡眠分期、ERP三大类任务上,与BENDR、BIOT、LaBraM三大通用模型对比(均采用线性探测),EEGPT全面取得最优性能。值得注意的是,BENDR采用全模型微调,而EEGPT仅训练线性分类头,仍取得更优性能,充分证明了预训练特征的通用性与高质量。

5.2 消融实验结果

表6 消融实验结果
变体 L A \mathcal{L}_A LA L R \mathcal{L}_R LRBCIC-2A-BACBCIC-2B-AUROCKaggleERN-AUROC
A: w/o L A \mathcal{L}_A LA37.130.570.5287±0.00860.7264±0.03810.5752±0.0164
B: w/o LN0.150.0020.5567±0.00880.7920±0.00120.5891±0.0227
C: w/o skip0.120.560.5796±0.00110.7702±0.01220.6356±0.0296
D: with all0.240.560.5846±0.00700.8059±0.00320.6621±0.0096

通过消融验证各模块的有效性:

  1. 移除对齐损失:重建损失变化不大,但下游任务性能下降6%~9%,证明时空对齐是提升特征质量的核心;
  2. 移除目标层归一化:预训练损失降低,但受极值与协变量偏移影响,下游性能下降1%~7%;
  3. 移除跳跃连接:对齐损失降低,但下游性能下降1%~3%,证明跳跃连接对保留细节、加速收敛的作用。

5.3 预训练实验结果

实验验证了EEGPT符合大模型缩放规律:

  1. 模型参数量缩放:随着参数量从0.4M增长到101M,下游任务准确率持续提升,拟合得到缩放公式: A C C = ( 33.6 ∗ N ) 0.029 ACC=(33.6 * N)^{0.029} ACC=(33.6N)0.029 L R = ( 0.72 ∗ N ) − 0.014 \mathcal{L}_R=(0.72 * N)^{-0.014} LR=(0.72N)0.014

在这里插入图片描述

图5 EEGPT的参数缩放规律
  1. 预训练数据量缩放:预训练数据量越大,下游性能越高,数据量与准确率呈正相关缩放关系。
表7 预训练实验结果
变体 d e d_e de层数 S S S参数量 L A \mathcal{L}_A LA L R \mathcal{L}_R LRBCIC-2A-BAC(%)
tiny1642/2/410.4M0.320.6049.19
tiny2642/2/440.5M0.360.6050.03
tiny3648/8/841.6M0.170.5951.58
little1288/8/846.4M0.180.5754.18
base12566/6/6119M0.240.5654.53
base22568/8/8425M0.330.5656.48
base35126/6/6176M0.140.5854.47
large5128/8/84101M0.240.5658.46

5.4 可视化分析

  1. 通道嵌入可视化:训练后的通道嵌入相似度符合脑区空间分布,邻近电极相似度高,同时也能学习到对侧脑区的长程关联;

在这里插入图片描述

图6 通道嵌入相似度连接图
  1. 特征可视化:t-SNE显示不同类别的特征具有清晰的聚类边界,具备良好的线性可分性;

在这里插入图片描述

图7 BCIC2A的t-SNE图
  1. 注意力可视化:P300任务中模型注意力集中在刺激后0~1s的时域窗口,以及额中区电极,符合神经科学认知。

在这里插入图片描述

图8 P300时空注意力图

6 讨论

6.1 局限性

  1. 规模仍有差距:尽管已构建多范式混合数据集与千万级模型,但与视觉、语言领域的大模型相比,数据规模与参数量仍有较大差距,脑电大模型仍处于初步探索阶段。
  2. 显存开销较高:即使采用线性探测适配小样本下游任务,基础模型本身仍具有一定的显存占用,边缘部署仍需优化。
  3. 序列长度受限:预训练采用4s时长的EEG片段,对长时连续脑电信号(如整夜睡眠、长时监测)的适配能力有待验证。

6.2 未来工作

  1. 扩充预训练数据:进一步丰富预训练数据集的范式、被试数量与场景,构建更全面的EEG预训练语料;
  2. 探索更大规模模型:持续扩大模型参数量,验证脑电大模型的缩放上限,探索更强的通用表征能力;
  3. 长时序建模:研究长序列EEG的预训练方法,拓展模型在连续监测、长时睡眠分期等场景的适用性;
  4. 跨模态拓展:将框架拓展至更多生物信号(如ECG、fNIRS),探索通用生物信号大模型的可能性。

7 总结

EEGPT是脑电预训练领域的重要进展,首次提出时空表示对齐+掩码重建的双自监督框架,针对性解决了低信噪比下EEG特征质量差、通道适配性弱、跨范式通用性不足的核心痛点。

其分层时空解耦的架构设计,兼顾了计算效率与模型灵活性;千万级参数量与多范式混合预训练,验证了脑电领域“模型越大、数据越多,性能越好”的缩放规律。在运动想象、睡眠分期、事件相关电位等多个主流任务上,EEGPT以线性探测的轻量微调方式全面超越现有通用模型,为脑电通用表示学习提供了新的技术范式,也为后续脑电大模型的研究奠定了基础。

更多推荐