脑电大模型——第一篇:BENDR(BErt-inspired Neural Data Representations)
论文基本信息
Paper: BENDR: Using Transformers and a Contrastive Self-Supervised Learning Task to Learn From Massive Amounts of EEG Data
Institution: University of Toronto
Publication: Frontiers in Human Neuroscience
Year: 2021
Code: Open Source Code

1 摘要
论文针对脑电(EEG)信号分类数据匮乏、个体差异大的问题,提出一种名为BENDR的深度学习框架,将Transformer与对比式自监督学习相结合,在大规模未标注EEG数据上预训练通用特征表示。该方法首先通过卷积网络将原始EEG信号下采样为固定长度的向量序列(BENDR 表示),然后使用Transformer编码器对随机掩码后的时序特征进行对比学习。实验在多个脑机接口(BCI)任务和睡眠分期任务上微调测试,结果表明预训练特征具有跨被试、跨设备和跨任务的泛化能力,并显著提升下游分类性能(例如运动意象任务最佳平衡准确率达86.7%)。作者总结指出,此方法首次在原始EEG上采用Transformer结构和自监督预训练,有望通过利用海量未标注数据,推动EEG/BCI领域深度学习模型的迁移与应用。
2 背景
深度神经网络在BCI和EEG信号分类中具有自动提取特征的潜力,但标注数据稀缺且不同被试、会话、任务间存在显著差异,使得模型泛化困难。传统BCI研究中,浅层网络往往比深层网络表现更好,因为数据量不足以支撑复杂网络的训练。此外,不同任务的特征本质不同(如P300与运动想象的EEG特征),进一步加剧了领域转移的难度。因此,需要新的预训练和迁移学习方法,使模型能够利用海量未标注数据学习跨域通用的EEG表示。
3 贡献
设计了一种自监督序列学习方法,在大量未标注EEG数据上预训练通用表示,并检验该表示是否可迁移至不同被试、硬件和任务。借鉴自然语言和语音领域的自监督(wav2vec 2.0)预训练方法,通过掩码对比学习可以学习到稳定不变的EEG表征(称为BENDR),这些表征在新的EEG数据上依然有效。研究问题包括:BENDR能否对完全未知的新数据(不同设备、任务)产生准确建模?微调这些预训练特征能否在下游分类任务中超越传统方法?
4 方法
4.1 数据集
4.1.1 预训练数据集
预训练使用Temple University Hospital EEG Corpus(TUEG)数据集1.1和1.2版本,是迄今最大的公开EEG语料库之一,由超过10000人使用10-20系统进行的临床记录组成,其中一些记录间隔长达8个月,受试者中51%为女性,年龄范围从1岁以下到 90 岁以上(合计约1.5TB原始EDF文件)。
4.1.2 下游数据集
为了评估泛化性,选取了5个下游分类任务:3个常见运动想象任务(MMI、BCIC、ERN)、1个P300任务和1个睡眠分期(SSC)任务(各任务数据量、通道数、标签等见表1)。
| Dataset | Paradigm | sfreq. Hz | # Ch. | Subjects | Targets | Folds |
|---|---|---|---|---|---|---|
| MMI | MI(L/R) | 160 | 64 | 105 | 2 | 5 |
| BCIC | MI(L/R/F/T) | 250 | 22 | 9 | 4 | 9 |
| ERN | Error related negativity | 200 | 56 | 26(10) | 2 | 4 |
| P300 | Donchin speller | 2048 | 64 | 9 | 2 | 9 |
| SSC | Sleep Staging | 100 | 2 | 83 | 5 | 10 |
4.2 预处理
首先做每段序列的线性缩放和平移,把该段的幅值范围归一到[-1,1],但为了不完全丢掉“全局数据集相对幅度信息”,额外加入一个常数通道编码该段相对幅值范围 m a x ( s i ) − m i n ( s i ) m a x ( S d s ) − m i n ( S d s ) \frac{max(s_i)-min(s_i)}{max(S_{ds})-min(S_{ds})} max(Sds)−min(Sds)max(si)−min(si)(相对整个数据集的max-min比例)。然后将原始EEG信号统一重采样到256Hz。最后针对不同规格脑电帽的异构问题进行通道统一化处理,把通道对齐到10-20导联标准中的19个EEG通道,缺失通道补0,多余通道丢弃,加上前面的相对幅度常数通道,最终固定为20通道输入。在预训练过程中,从每个可用序列中提取60s的子序列,每个子序列有15360个样本。
4.3 模型架构
模型架构由两个阶段组成。
第一阶段为6层一维卷积编码器,经过预处理后的信号先通过6层一维卷积编码器下采样96倍生成BENDR表示序列。每个卷积编码器由一维卷积、Group Norm和GELU激活组成,除了第一个编码器的感受野为3,其余每个编码器的感受野为2,步长与每个块的感受野长度相匹配。因此,BENDR的有效采样频率比原始采样频率(256Hz)小96倍(≈2.67Hz),每个编码器由512个滤波器组成,每个生成的向量的长度为512。
第二阶段为8层8头的Transformer编码器,将BENDR映射到一些体现目标任务的新序列。每个Transformer编码器去掉内部批归一化层,并附带名为T-Fixup的权重初始化方案,模型维度为1536,内部前馈维度为3076,使用GELU激活,另外还包括Layer Drop和Dropout,概率分别为0.01和0.15,但在微调过程中都没有。无显式使用位置编码,而是在第一个卷积层添加了一维卷积来引入位置依赖。

4.4 训练与评估
4.4.1 预训练
采用类似wav2vec 2.0的掩码对比学习。具体做法为:随机选取BENDR序列中长度为10的连续片段进行掩码(掩码概率 p = 0.065 p=0.065 p=0.065),将这些片段替换为学习到的掩码向量;Transformer根据上下文预测被遮掩的BENDR向量。损失为对比损失:
L = − l o g e x p ( c o s s i m ( c t , b t ) ) / κ ∑ b i ∈ B D e x p ( c o s s i m ( c t , b i ) ) / κ \mathcal{L}=-log\frac{exp(cossim(c_t,b_t))/\kappa}{\sum_{b_i\in B_D}exp(cossim(c_t,b_i))/\kappa} L=−log∑bi∈BDexp(cossim(ct,bi))/κexp(cossim(ct,bt))/κ
对于每个被预测位置 t t t,其真实向量 b t b_t bt与Transformer输出 c t c_t ct的余弦相似度应最大,同时与同序列中20个随机负样本(其它位置的向量)相似度要低。即优化 c o s s i m ( c t , b t ) cossim(c_t,b_t) cossim(ct,bt)相对20个干扰负样本的损失,并加上BENDR向量激活平方和的正则化项。
4.4.2 下游微调
考虑了六种不同的迁移学习在下游EEG分类任务中的变化:
- 如图2.1所示,在Transformer输出后添加一个具有softmax激活的线性分类层,利用该层的输出对整个模型进行微调,从而对下游目标进行分类。
- 如图2.2所示,忽略预训练的Transformer,仅使用卷积部分生成固定长度特征向量(将60s BENDR分为4段求平均拼接),增加一个新的线性层softmax激活,根据平均BENDRs的级联向量对下游目标进行分类 。
- 同图2.1,但不进行预训练,从随机初始化的DNN开始,如图2.3所示。
- 同图2.1,但冻结BENDR(卷积阶段),微调Transformer,并训练新的分类层对下游目标进行分类,如图2.4所示。
- 同图2.2,但不进行预训练,从随机初始化的卷积阶段开始,如图2.5所示。
- 同图2.2,但冻结BENDR(卷积阶段),只训练新的分类层,如图2.6所示。

5 结果



| Dataset | Starts(s) | Length(s) | Metric | Best | Model config. |
|---|---|---|---|---|---|
| MMI | 0 | 6 | BAC | 86.7 | Linear(2.) |
| BCIC | -2 | 6 | Accuracy | 42.6 | Linear(2.) |
| ERN | -0.7 | 2 | AUROC | 0.65 | Linear(2.) |
| P300 | -0.7 | 2 | AUROC | 0.72 | BENDR(1.) |
| SSC | 0 | 30 | BAC | 0.72 | Linear(2.) |
5.1 预训练泛化性能
图3显示了Transformer预测BENDR时的准确性。结果显示,除了P300任务外,其余四个任务的Transformer预测准确度都很高且波动很小,说明预训练模型学到的序列特征对新被试、设备和任务具有通用性。图中P300数据集明显低于其他下游数据集,这与最短评价序列相吻合,在图4中,当用20秒的数据评估时,所有五个数据集都具有一致的性能。由此可见P300表现较低主要因为有效的输入序列非常短(2s),而更长上下文时效果趋于一致。
5.2 下游微调性能
表2汇总了各任务的最佳实验结果,图5展示了不同配置下的实验结果。在所有测试的下游任务中,以配置2(仅用预训练卷积+线性分类器)获得了4/5任务的最高性能,配置1(全模型微调)在P300任务中表现最好。采用配置2时,MMI任务的平衡准确率(BAC)达到86.7%,SSC(睡眠分期)的BAC为0.72,BCIC和ERN任务的最佳准确率/AUROC分别为42.6%和0.65。相比之下,不使用预训练的模型(配置3和配置5)通常表现接近随机,仅SSC任务因数据量较大略好。整体来看,预训练特征微调后的模型在MMI、SSC等任务上优于或持平于已有方法,尤其在睡眠分期任务上超过了此前对比自监督方法。
6 讨论
6.1 局限性
- 模型复杂度高:所用Transformer模型参数超过10亿,训练需要大量计算资源。论文中随机初始化的全模型在数据不足情况下效果较差,表明无预训练时难以收敛。
- 只考虑时间特征:架构中主要聚焦时域特征,未对空间(电极分布)信息进行专门建模。预处理将原始64通道EEG缩减为19通道10/20配置,可能丢失部分空间特征。作者指出未来应在更高通道数数据(如MASS睡眠数据集)上评估模型,以研究空间信息的影响。
- 数据与任务局限:预训练仅使用TUEG临床数据,可能存在偏倚(例如病人信号特征)。下游任务的样本相对较小,尤其P300窗口极短使模型难以学习有效特征(表现欠佳)。另外,只选取部分BCI任务来测试,尚不清楚对其他范式(如大规模连续EEG)是否同样有效。
- 超参数敏感性:选择掩码概率、负样本数等对训练稳定性影响较大。文中说明在训练过程中需要调整下采样率等参数以避免模型退化,这些细节在不同数据集上可能需重新调优。
- 潜在偏差:由于所有数据都经过归一化处理和频道映射,模型可能对信号幅度信息不敏感,只依赖相对特征。此外,表征和Transformer可能学到一些非信号特征(如设备间系统噪声等),需要进一步分析特征可解释性。
6.2 未来工作
- 引入空间信息:结合CNN或其他空间滤波方法,将电极空间模式融入模型。例如在更高通道数的数据集(如加拿大MASS睡眠资料)上预训练,以验证BENDR在多空间维度下的泛化性。
- 多任务预训练集:构建跨范式的大规模EEG数据集(类比ImageNet),包括多种BCI任务的标签,进行混合预训练,以学习更通用的生物信号表示。可探索长尾分布下的类不平衡问题。
- 优化预训练目标:尝试不同的自监督任务,如信号重建(seq2seq)或序列生成,以替代或补充对比损失。例如借鉴SincNet等技术加强对不同频段的建模,或采用显式位置编码替代卷积定位,提高模型对更长序列的建模能力。
- 模型轻量化与部署:考虑在边缘设备上应用时,可以研究低参数版本的BENDR或知识蒸馏方案,使得预训练模型更易部署。
- 跨领域应用:将BENDR预训练的思路推广到其他生理信号(如肌电、心电等),或用于神经影像(fMRI)数据,以评估自监督策略的通用性。
7 总结
BENDR作为第一个提出将自监督学习应用于脑电信号预训练以提取脑电信号通用特征的文章,已经有了脑电大模型的雏形思想。与传统的ImageNet式迁移学习不同,自监督掩码式预训练能更充分利用大规模未标注EEG数据。实验结果表明,一个通过BENDR预训练得到的模型能对全新的EEG信号(不同硬件、被试、任务)产生准确特征,且微调后在多种BCI任务上表现优异。
BENDR提出了将Transformer应用于原始EEG的对比自监督框架,验证了其学习到的特征在不同下游任务中的有效性;在睡眠阶段分类任务上超过先前自监督工作;并提供了公开的源代码和预训练模型。结论指出,此方法为脑电分析和生物信号的深度学习预训练提供了新思路,可在更广泛的神经成像领域中推广。
更多推荐
所有评论(0)