脑电大模型——第四篇:EEGPT(EEG Pretrained Transformer)
论文基本信息
Paper: Large Brain Model for Learning Generic Representations with Tremendous EEG Data in BCI
Institution: Harbin Institute of Technology
Publication: Neural Information Processing Systems
Year: 2024
Code: Open Source Code

1 摘要
论文针对脑电(EEG)信号信噪比低、被试间差异大、通道配置不匹配,导致鲁棒通用的特征提取困难的问题,提出了名为EEGPT的预训练Transformer模型,参数量超千万级,面向通用EEG特征提取任务。该模型设计了基于掩码的双自监督学习方法,在传统掩码重建的基础上引入时空表征对齐:以高信噪比、富含语义的EEG表征为自监督目标,而非原始信号,缓解了低信噪比下特征提取质量差的问题。同时模型采用分层结构,分别对空间与时间信息进行解耦处理,在降低计算复杂度的同时,提升了BCI场景下的灵活性与适配性。实验验证,在线性探测(linear-probing)设定下,模型在运动想象、事件相关电位检测、睡眠分期等多种下游任务上均达到SOTA性能,验证了方法的有效性与可扩展性,为脑电表示学习与生物信号处理提供了新的解决方案。
2 背景
脑电图(EEG)通过记录大脑皮层电信号动态反映脑功能状态,在医学、神经科学与脑机接口(BCI)领域具有核心价值,但其自身特性带来了诸多应用挑战:
- 信噪比(SNR)极低:脑电信号微弱,易受噪声干扰,传统方法难以提取稳定的抽象特征;
- 被试间差异显著:不同个体的脑电模式差异大,跨被试泛化难度高;
- 通道与采样率异构:不同采集设备的电极数量、位置、采样率不一致,模型通用性受限;
- 任务依赖性显著:脑电信号与任务类型相绑定,跨任务泛化难度高,模型通用性受限。
自监督学习在NLP、CV、语音领域已验证了强大的通用表征能力,通过大规模无标注数据预训练+下游微调的范式,可大幅降低对标注数据的依赖。其中掩码自编码器(MAE)通过恢复被掩码的输入片段学习特征,在BERT、MAE等工作中取得了巨大成功。
近年来,EEG领域也涌现出一批自监督预训练工作,但仍存在明显局限:
- BENDR:结合卷积编码器与Transformer,融合掩码重建与对比学习,但以原始信号为重建目标,低信噪比下特征质量受限;
- EEG2VEC:基于对比损失和重建损失学习EEG表征的自监督模型,预训练好的模型作为下游任务的特征提取器;
- BIOT:针对多生物信号跨数据学习设计,采用分通道token化,但对时域精细特征建模不足,在ERP类任务上表现受限;
- LaBraM:通过神经令牌化实现跨数据集学习,但对时空信息的解耦与利用仍有提升空间。
整体而言,现有通用EEG模型在低信噪比信号的特征质量、跨设备通道适配性、多范式任务通用性上仍有不足,亟需更高效的预训练框架。
3 贡献
提出了一种基于EEG信号时空一致性的双自监督EEG通用表示方法EEGPT(EEG Pretrained Transformer)进行高效的特征提取,包括时空表示对齐和基于掩膜的重建,增强了表示质量和模型鲁棒性。
- 提出通用EEG预训练模型EEGPT:构建了千万级参数量的Transformer架构,通过多范式混合数据集预训练,显著提升了跨任务、跨被试的特征泛化能力。
- 设计双自监督预训练方法:融合时空表征对齐与掩码重建两个自监督任务,以高信噪比的完整信号表征为对齐目标,提升了编码特征的语义丰富度与模型收敛效率。
- 分层时空解耦架构:先从短时EEG中提取稳定空间表征,再建模长时时序关联,既降低了计算复杂度,也增强了模型在不同BCI场景下的灵活性与适配性。
- 局部时空嵌入与通道自适应:设计可学习通道嵌入词典(Codex book),灵活适配不同采集设备的通道配置,提升了模型在异构数据上的鲁棒性。
- 系统性实验验证:在7个下游数据集、多种EEG范式上全面超越现有通用模型,验证了模型缩放定律——参数量与预训练数据量越大,下游性能持续提升。
4 方法
4.1 数据集
4.1.1 预训练数据集
选取5种不同范式的公开EEG数据集构建混合预训练语料,覆盖运动想象、稳态视觉诱发电位、情绪识别、多范式生物特征等场景:
| 数据集 | 范式 | 被试数 | 类别数 |
|---|---|---|---|
| PhysioMI | 运动想象/运动执行 | 109 | 5 |
| HGD | 运动想象 | 14 | 4 |
| TSU | 稳态视觉诱发电位(SSVEP) | 35 | 40 |
| SEED | 情绪分类 | 15 | 3 |
| M3CV | 多范式(静息、ERP、P300等) | 106 | - |
4.1.2 下游数据集
选取7个主流下游任务数据集,全面验证模型的跨范式泛化能力:
| 数据集 | 范式 | 被试数 | 类别数 |
|---|---|---|---|
| BCIC-2A | 运动想象(4类) | 10 | 4 |
| BCIC-2B | 运动想象(2类) | 10 | 2 |
| Sleep-EDFx | 睡眠分期 | 197 | 5 |
| KaggleERN | 错误相关负波(ERN) | 36 | 2 |
| PhysioP300 | P300事件相关电位 | 9 | 2 |
| TUAB | 脑电异常检测 | 2383 | 2 |
| TUEV | 脑电事件分类 | 288 | 6 |
4.2 预处理
所有数据集执行统一的基础预处理流程:
- 信号裁剪为4s时长片段;
- 采用全局平均参考进行重参考;
- 统一通道选择与幅值缩放(单位为mV);
- 重采样至统一采样率256Hz;
- 运动想象类下游任务额外添加0-38Hz带通滤波。
4.3 模型架构
EEGPT整体采用“分块-嵌入-掩码-编码-预测-重建”的层级结构,核心分为局部时空嵌入、编码器、预测器、动量编码器、重建器五大模块,整体结构如下图所示:

4.3.1 局部时空嵌入

首先将输入EEG信号(M个通道、T个时间点)在时空维度划分为互不重叠的patch:每个patch 对应单个通道的一段时长信号(时长64个采样点,约250ms)。
p i , j = x i , ( j − 1 ) d : j d p_{i,j} = x_{i,\, (j-1)d : jd} pi,j=xi,(j−1)d:jd
对每个patch执行两步嵌入:
- 线性嵌入:通过一维卷积将patch的时域波形 p i , j p_{i,j} pi,j映射为固定维度特征向量;
- 通道嵌入:构建可学习的通道嵌入词典(Codex book),所用到的通道如图3所示,通过通道名称到嵌入向量的映射
ς
i
\varsigma_i
ςi,将空间位置信息融入特征,灵活适配不同数据集的通道配置。
t o k e n i , j = E m b e d ( p i , j ) + ς i token_{i,j} = \mathrm{Embed}(p_{i,j}) + \varsigma_i tokeni,j=Embed(pi,j)+ςi
最终每个patch对应一个token,同时保留通道与时间维度的结构信息。

4.3.2 双自监督核心结构
预训练采用50%时间patch+80%通道patch的掩码策略,仅将掩码后的token输入编码器,通过双分支任务完成自监督学习。
- 编码器(Encoder)
以同一时间片下所有掩码通道的token为输入,通过Transformer融合空间信息,输出该时间片的空间表征;同时引入可学习的summary token,聚合单时间片内的全局信息。
e n c j = E N C ( { t o k e n i , j } ( i , j ) ∈ M ) enc_j = \mathrm{ENC}\left( \substack{\{ token_{i,j} \} \\ (i,j) \in \mathcal{M}} \right) encj=ENC({tokeni,j}(i,j)∈M) - 预测器(Predictor)
接收编码器输出的掩码时间片特征,结合旋转位置编码(RoPE)引入时序信息,通过可学习的query token预测出所有时间片的完整特征序列。该设计将空间编码与时序预测解耦,大幅降低了计算复杂度。
{ p r e d t } t ∈ { 1 , 2 , … , N } = P R E D ( { e n c j + p o s j } ∃ i , ( i , j ) ∈ M ) \{ pred_t \}_{\substack{t \in \{1,2,\dots,N\} }} = \mathrm{PRED}\left( \substack{ \{ enc_j + pos_j \} \\ \exists i,\, (i,j) \in \mathcal{M} } \right) {predt}t∈{1,2,…,N}=PRED({encj+posj}∃i,(i,j)∈M) - 动量编码器(Momentum Encoder)
结构与编码器完全一致,输入完整的未掩码token,输出高质量的全局表征作为对齐目标;其参数通过编码器参数的动量更新(更新系数0.01)得到,避免训练过程中目标波动过大。
m e n c j = M E N C ( { t o k e n i , j } ( i , j ) ∈ M ∪ M ‾ ) menc_j = \mathrm{MENC}\left( \substack{ \{ token_{i,j} \} \\ (i,j) \in \mathcal{M} \cup \overline{\mathcal{M}} } \right) mencj=MENC({tokeni,j}(i,j)∈M∪M) - 重建器(Reconstructor)
融合编码器的掩码特征与预测器的预测特征,通过跳跃连接保留底层细节,重建出未掩码区域的原始EEG patch。
{ r e c u , t } ( u , t ) ∈ M ‾ = R E C ( { e n c j + p o s j } ∃ i , ( i , j ) ∈ M ∪ { p r e d j + p o s j } ∀ i , ( i , j ) ∈ M ‾ ) \substack{ \{ rec_{u,t} \} \\ (u,t) \in \overline{\mathcal{M}} } = \mathrm{REC}\left( \substack{ \{ enc_j + pos_j \} \\ \exists i,\, (i,j) \in \mathcal{M} } \cup \substack{ \{ pred_j + pos_j \} \\ \forall i,\, (i,j) \in \overline{\mathcal{M}} } \right) {recu,t}(u,t)∈M=REC({encj+posj}∃i,(i,j)∈M∪{predj+posj}∀i,(i,j)∈M)
4.3.3 双自监督损失函数
总损失由对齐损失与重建损失两部分构成,均采用均方误差(MSE)计算:
- 时空表示对齐损失:约束预测器输出的特征与动量编码器输出的完整信号特征对齐,迫使编码器提取富含语义、鲁棒的全局表征,提升特征质量;
L A = − 1 N ∑ j = 1 N ∥ p r e d j , L N ( m e n c j ) ∥ 2 2 \mathcal{L}_A = -\frac{1}{N} \sum_{j=1}^{N} \left\| pred_j,\, \mathrm{LN}(menc_j) \right\|_2^2 LA=−N1j=1∑N∥predj,LN(mencj)∥22 - 掩码重建损失:约束重建patch与原始patch的波形一致,利用脑电信号的时空一致性补充细节特征;
L R = − 1 ∣ M ‾ ∣ ∑ ( i , j ) ∈ M ‾ ∥ r e c i , j , L N ( p i , j ) ∥ 2 2 \mathcal{L}_R = -\frac{1}{|\overline{\mathcal{M}}|} \sum_{(i,j) \in \overline{\mathcal{M}}} \left\| rec_{i,j},\, \mathrm{LN}(p_{i,j}) \right\|_2^2 LR=−∣M∣1(i,j)∈M∑∥reci,j,LN(pi,j)∥22 - 总损失:完整的预训练损失
L
\mathcal{L}
L由
L
A
\mathcal{L}_A
LA和
L
R
\mathcal{L}_R
LR两部分求和构造而成。
L = L A + L R \mathcal{L} = \mathcal{L}_A + \mathcal{L}_R L=LA+LR
4.3.4 下游线性探测(Linear-probing)
下游任务采用线性探测范式,如图4所示,冻结预训练编码器的全部参数,仅新增少量可训练模块:

- 自适应空间滤波:1×1卷积,用于对齐下游数据与预训练模型的通道差异;
- 线性分类头:将summary token输出的特征映射为类别logits。
该范式既大幅降低了下游训练的计算开销,也能更公平地验证预训练特征的质量,同时避免小样本下的过拟合问题。
4.4 训练与评估
4.4.1 预训练设置
- 模型变体:设计8种不同参数量的模型变体,验证缩放效应;最优大模型为8层Transformer、512维嵌入、4个summary token,参数量约1.01亿;
- 优化器:AdamW,采用OneCycle学习率策略(初始2.5e-4,峰值5e-4,最低3.13e-5);
- 训练轮次:200epoch,64batch size,16位混合精度训练;
- 硬件:8张NVIDIA 3090 GPU。
4.4.2 评估策略
- TUAB与TUEV数据集:严格遵循BIOT的实验配置与数据划分,保证公平对比;
- 其余下游任务:遵循BENDR的实验配置,采用留一被试交叉验证(LOSO);
- 所有实验重复3次,报告均值与标准差,确保结果可靠。
5 结果
5.1 下游实验结果
| 方法 | 模型大小 | Balanced Accuracy | AUROC |
|---|---|---|---|
| SPaRCNet | 0.79M | 0.7896±0.0018 | 0.8676±0.0012 |
| ContraWR | 1.6M | 0.7746±0.0041 | 0.8456±0.0074 |
| CNN-T | 3.2M | 0.7777±0.0022 | 0.8461±0.0013 |
| FFCL | 2.4M | 0.7848±0.0038 | 0.8569±0.0051 |
| ST-T | 3.5M | 0.7966±0.0023 | 0.8707±0.0019 |
| BIOT | 3.2M | 0.7959±0.0057 | 0.8815±0.0043 |
| Ours-Tiny | 4.7M | 0.7959±0.0021 | 0.8716±0.0041 |
| Ours | 25M | 0.7983±0.0030 | 0.8718±0.0050 |
| 方法 | 模型大小 | Balanced Accuracy | Weighted F1 | Cohen’s Kappa |
|---|---|---|---|---|
| SPaRCNet | 0.79M | 0.4161±0.0262 | 0.7024±0.0104 | 0.4233±0.0181 |
| ContraWR | 1.6M | 0.4384±0.0349 | 0.6893±0.0136 | 0.3912±0.0237 |
| CNN-T | 3.2M | 0.4087±0.0161 | 0.6854±0.0293 | 0.3815±0.0134 |
| FFCL | 2.4M | 0.3979±0.0104 | 0.6783±0.0120 | 0.3732±0.0188 |
| ST-T | 3.5M | 0.3984±0.0228 | 0.6823±0.0190 | 0.3765±0.0306 |
| BIOT | 3.2M | 0.5281±0.0225 | 0.7492±0.0082 | 0.5273±0.0249 |
| Ours-Tiny | 4.7M | 0.5670±0.0066 | 0.7535±0.0097 | 0.5085±0.0173 |
| Ours | 25M | 0.6232±0.0114 | 0.8187±0.0063 | 0.6351±0.0134 |
在临床EEG数据集TUAB与TUEV上与现有方法对比:
- TUAB(异常检测):EEGPT性能与BIOT相当,25M参数量版本平衡准确率达0.7983,AUROC达0.8718;
- TUEV(事件分类):EEGPT大幅领先,25M版本平衡准确率达0.6232,相比BIOT提升9.5%;加权F1达0.8187,相比BIOT提升6.9%。

在运动想象、睡眠分期、ERP三大类任务上,与BENDR、BIOT、LaBraM三大通用模型对比(均采用线性探测),EEGPT全面取得最优性能。值得注意的是,BENDR采用全模型微调,而EEGPT仅训练线性分类头,仍取得更优性能,充分证明了预训练特征的通用性与高质量。
5.2 消融实验结果
| 变体 | L A \mathcal{L}_A LA | L R \mathcal{L}_R LR | BCIC-2A-BAC | BCIC-2B-AUROC | KaggleERN-AUROC |
|---|---|---|---|---|---|
| A: w/o L A \mathcal{L}_A LA | 37.13 | 0.57 | 0.5287±0.0086 | 0.7264±0.0381 | 0.5752±0.0164 |
| B: w/o LN | 0.15 | 0.002 | 0.5567±0.0088 | 0.7920±0.0012 | 0.5891±0.0227 |
| C: w/o skip | 0.12 | 0.56 | 0.5796±0.0011 | 0.7702±0.0122 | 0.6356±0.0296 |
| D: with all | 0.24 | 0.56 | 0.5846±0.0070 | 0.8059±0.0032 | 0.6621±0.0096 |
通过消融验证各模块的有效性:
- 移除对齐损失:重建损失变化不大,但下游任务性能下降6%~9%,证明时空对齐是提升特征质量的核心;
- 移除目标层归一化:预训练损失降低,但受极值与协变量偏移影响,下游性能下降1%~7%;
- 移除跳跃连接:对齐损失降低,但下游性能下降1%~3%,证明跳跃连接对保留细节、加速收敛的作用。
5.3 预训练实验结果
实验验证了EEGPT符合大模型缩放规律:
- 模型参数量缩放:随着参数量从0.4M增长到101M,下游任务准确率持续提升,拟合得到缩放公式: A C C = ( 33.6 ∗ N ) 0.029 ACC=(33.6 * N)^{0.029} ACC=(33.6∗N)0.029和 L R = ( 0.72 ∗ N ) − 0.014 \mathcal{L}_R=(0.72 * N)^{-0.014} LR=(0.72∗N)−0.014;

- 预训练数据量缩放:预训练数据量越大,下游性能越高,数据量与准确率呈正相关缩放关系。
| 变体 | d e d_e de | 层数 | S S S | 参数量 | L A \mathcal{L}_A LA | L R \mathcal{L}_R LR | BCIC-2A-BAC(%) |
|---|---|---|---|---|---|---|---|
| tiny1 | 64 | 2/2/4 | 1 | 0.4M | 0.32 | 0.60 | 49.19 |
| tiny2 | 64 | 2/2/4 | 4 | 0.5M | 0.36 | 0.60 | 50.03 |
| tiny3 | 64 | 8/8/8 | 4 | 1.6M | 0.17 | 0.59 | 51.58 |
| little | 128 | 8/8/8 | 4 | 6.4M | 0.18 | 0.57 | 54.18 |
| base1 | 256 | 6/6/6 | 1 | 19M | 0.24 | 0.56 | 54.53 |
| base2 | 256 | 8/8/8 | 4 | 25M | 0.33 | 0.56 | 56.48 |
| base3 | 512 | 6/6/6 | 1 | 76M | 0.14 | 0.58 | 54.47 |
| large | 512 | 8/8/8 | 4 | 101M | 0.24 | 0.56 | 58.46 |
5.4 可视化分析
- 通道嵌入可视化:训练后的通道嵌入相似度符合脑区空间分布,邻近电极相似度高,同时也能学习到对侧脑区的长程关联;

- 特征可视化:t-SNE显示不同类别的特征具有清晰的聚类边界,具备良好的线性可分性;

- 注意力可视化:P300任务中模型注意力集中在刺激后0~1s的时域窗口,以及额中区电极,符合神经科学认知。

6 讨论
6.1 局限性
- 规模仍有差距:尽管已构建多范式混合数据集与千万级模型,但与视觉、语言领域的大模型相比,数据规模与参数量仍有较大差距,脑电大模型仍处于初步探索阶段。
- 显存开销较高:即使采用线性探测适配小样本下游任务,基础模型本身仍具有一定的显存占用,边缘部署仍需优化。
- 序列长度受限:预训练采用4s时长的EEG片段,对长时连续脑电信号(如整夜睡眠、长时监测)的适配能力有待验证。
6.2 未来工作
- 扩充预训练数据:进一步丰富预训练数据集的范式、被试数量与场景,构建更全面的EEG预训练语料;
- 探索更大规模模型:持续扩大模型参数量,验证脑电大模型的缩放上限,探索更强的通用表征能力;
- 长时序建模:研究长序列EEG的预训练方法,拓展模型在连续监测、长时睡眠分期等场景的适用性;
- 跨模态拓展:将框架拓展至更多生物信号(如ECG、fNIRS),探索通用生物信号大模型的可能性。
7 总结
EEGPT是脑电预训练领域的重要进展,首次提出时空表示对齐+掩码重建的双自监督框架,针对性解决了低信噪比下EEG特征质量差、通道适配性弱、跨范式通用性不足的核心痛点。
其分层时空解耦的架构设计,兼顾了计算效率与模型灵活性;千万级参数量与多范式混合预训练,验证了脑电领域“模型越大、数据越多,性能越好”的缩放规律。在运动想象、睡眠分期、事件相关电位等多个主流任务上,EEGPT以线性探测的轻量微调方式全面超越现有通用模型,为脑电通用表示学习提供了新的技术范式,也为后续脑电大模型的研究奠定了基础。
更多推荐
所有评论(0)