脑电大模型——第五篇:NeuroLM(Neuro Language Model)
论文基本信息
Paper: NeuroLM: A Universal Multi-task Foundation Model for Bridging the Gap between Language and EEG Signals
Institution: Shanghai Jiao Tong University
Publication: International Conference on Learning Representations
Year: 2025
Code: Open Source Code

1 摘要
论文针对现有EEG预训练模型需针对每个下游任务全量微调、通用性差、计算与存储资源浪费严重的问题,提出NeuroLM——首个融合大语言模型能力的EEG多任务基础模型,其核心思想是将EEG信号视作一门“外语”接入LLM框架。模型训练分为三个阶段:首先通过向量量化时频预测来训练文本对齐的神经分词器,将连续EEG信号编码为离散神经token;随后冻结VQ编码器,将EEG token输入大语言模型,通过多通道自回归预训练学习EEG的因果时序信息;最终通过多任务指令微调,让单模型适配各类下游任务。最大变体NeuroLM-XL拥有17亿参数,是目前参数规模最大的EEG信号处理模型之一,在约25000小时的大规模EEG语料上完成预训练。在6类差异显著的下游EEG数据集上的实验证明,该多任务学习范式具备极强的应用潜力。
2 背景
脑电(EEG)作为非侵入式神经信号采集技术,凭借高时间分辨率、低成本、便携性优势,已成为脑机接口(BCI)与医疗健康领域的核心工具,广泛应用于情绪识别、运动想象、睡眠分期、癫痫检测、疲劳检测等场景。
但EEG信号本身存在信噪比低、非平稳性强、采集配置(通道数、采样率)不统一的问题,同时高质量标注数据稀缺,导致通用EEG表征提取难度大。现有EEG预训练方法(如BIOT、LaBraM)虽能通过大规模无监督预训练学习通用表征,但仍存在核心局限:
- 必须针对每个下游任务单独微调,微调后模型仅能执行单一任务;
- 逐任务微调消耗大量计算与存储资源,复用性差。
大语言模型(LLM)与多模态大模型(MLLM)的兴起为统一多任务提供了新思路,但将LLM迁移至EEG领域面临三大挑战:
- EEG-文本嵌入对齐难:缺乏高质量EEG-文本配对数据,无法像图文模型那样实现细粒度语义对齐;
- LLM范式下的表征学习难:EEG主流预训练为掩码建模,如何适配自回归LLM的训练范式尚无成熟方案;
- 多任务统一难:不同EEG任务的范式、标签、数据格式差异巨大,单模型兼顾所有任务且不损失性能难度极高。
3 贡献
- 文本对齐的神经分词器嵌入
提出基于向量量化时频预测的神经分词器,将EEG信号转换为离散编码;通过对抗训练与梯度反转层实现EEG与文本的嵌入空间级对齐,让EEG token可直接接入现成LLM,打通了模态融合的基础。 - 大规模多通道自回归预训练
设计适配多通道EEG的自回归预训练策略与阶梯式注意力掩码,让模型学习跨通道的因果神经表征;基于25000小时大规模EEG数据预训练,大幅提升模型跨任务、跨配置的泛化能力。 - 联合多任务微调与推理
首次将指令微调引入EEG信号处理领域,为不同下游任务设计专属指令模板,实现单模型同时执行多种EEG分类任务,无需逐任务单独微调,显著提升了模型复用效率。
4 方法
4.1 数据集
4.1.1 预训练数据集
使用了多个具有不同配置的EEG数据集,所有数据集的详细信息见表1,数据清洗后的总时间接近25000小时。
| 数据集 | 通道数量 | 采样率(Hz) | 总时长(h) | 数据集描述 |
|---|---|---|---|---|
| TUEG | 17‑23 | 250‑1024 | ~24000 | 由天普大学医院采集得到,包含26846份临床脑电记录 |
| SEED系列 | 62 | 1000 | 170.54 | 数据集包含SEED‑IV(15名受试者)、SEED‑V(20名受试者)、SEED‑GER(8名受试者)、SEED‑FRA(8名受试者),受试者观看情绪视频诱发对应情绪 |
| BCI竞赛IV‑1 | 59 | 1000 | 8.21 | 运动想象数据集,共7名受试者,包含左手、右手、足部共2类运动想象任务(含空闲状态) |
| Emobrain | 64 | 1024 | 4.94 | 多模态情绪数据集,共16名受试者,采用IAPS情绪图片子集来诱发被试情绪 |
| Grasp and Lift | 32 | 500 | 11.72 | 数据集包含12名受试者,完成抓举(GAL)实验任务 |
| Inria BCI | 56 | 600 | 29.98 | 基于P300信号的拼写数据集,共26名受试者 |
| 运动执行/想象 | 64 | 160 | 47.3 | 运动想象数据集,109名志愿者完成2项基线任务、真实肢体运动任务与运动想象任务 |
| Raw EEG Data | 64 | 256 | 34.35 | 在信息整合分类任务、多维规则分类任务采集原始脑电信号 |
| 静息态数据集 | 64 | 256 | 3.04 | 22名受试者完成8分钟静息任务:4分钟闭眼、4分钟睁眼 |
| Siena头皮脑电数据库 | 31 | 512 | 30.47 | 数据集包含14名患者 |
| SPIS静息态数据集 | 64 | 2048 | 0.83 | 10名受试者,先采集2.5分钟闭眼+睁眼静息脑电,之后完成105分钟持续响应注意力任务,序列固定,刺激间隔可变 |
| 目标vs非目标 | 32 | 512 | 16 | 50名受试者完成Brain Invaders视觉P300脑机接口实验,采用奇刺激范式,使用自适应黎曼几何方法,无需校准 |
| 自采集脑电数据集 | 62 | 1000 | 342.23 | 自研混合脑电数据集,包含超过140名受试者,覆盖多种实验条件 |
4.1.2 下游数据集
选取 6 个差异极大的 EEG 数据集验证多任务性能,覆盖异常检测、事件分类、情绪识别、睡眠分期、认知负荷检测、慢波事件分类六大典型任务,具体信息如下:
| 数据集 | 任务类型 | 采样率(Hz) | 通道数 | 样本数 | 类别数 |
|---|---|---|---|---|---|
| TUAB | 脑电异常检测 | 256 | 23 | 409455 | 2 |
| TUEV | 脑电事件分类 | 256 | 23 | 112491 | 6 |
| SEED | 情绪识别 | 1000 | 62 | 38475 | 3 |
| HMC | 睡眠分期 | 256 | 4 | 137243 | 5 |
| Workload | 认知负荷分类 | 500 | 19 | 92088 | 2 |
| TUSL | 慢波事件分类 | 256 | 23 | 245 | 3 |
4.2 预处理
为去除环境与生理伪迹、统一数据格式,执行标准预处理流程:
- 带通滤波:设置0.1Hz-75Hz截止频率,保留有效脑电频段;
- 陷波滤波:根据数据采集地区设置50Hz或60Hz陷波,去除工频干扰;
- 重采样:所有信号统一重采样至200Hz,降低计算复杂度;
- 幅值归一化:将信号值除以100,把EEG典型幅值范围(-100μV~100μV)归一化到[-1,1]区间。
4.3 模型架构
NeuroLM以GPT-2为基座LLM,包含三个规模变体:NeuroLM-B(2.54亿参数)、NeuroLM-L(5亿参数)、NeuroLM-XL(16.96亿参数)。整体采用三阶段训练范式:
4.3.1 文本对齐神经分词器训练
为了将EEG纳入到现有的大语言模型中,首先需要将EEG信号编码成与文本嵌入空间对齐的嵌入,文本对齐神经分词器基本沿用了LaBraM成熟的神经表征器,并做了一些改进,向量量化的时间频率预测用于训练文本对齐的神经表征器,如图1所示。

神经分词器由VQ编码器、码本、时域/频域解码器、域分类器四部分组成。
- 分块与编码:将多通道EEG切分为不重叠patch(patch大小200,对应1秒),经时域卷积编码器提取时序特征,加入可学习的时空位置嵌入后,通过空间Transformer学习通道间关联;
- 向量量化:将每个patch表征映射到码本中距离最近的离散编码,形成离散神经token;码本规模为8192×128,采用L2归一化后计算余弦相似度匹配;
- 时频双域重建:同时重建原始时域信号与频域幅值,相比单一时域重建能捕捉更丰富的脑电节律特征,这与LaBraM回归傅里叶幅值和相位的做法不同,因为重构相位对神经表征器训练的贡献很小;
- 嵌入空间对齐:引入域分类器与梯度反转层,通过对抗训练混淆EEG与文本的域分布,让EEG token嵌入空间与文本嵌入空间对齐。
4.3.2 多通道自回归预训练
在将EEG数据传递到大语言模型之前,通过冻结的VQ编码器将输入的EEG数据编码到与文本空间对齐的EEG token中,之后加载预训练的大语言模型,并利用学习到的EEG码本扩充文本词汇。EEG token添加了从LLM中复用的时间嵌入和新的空间嵌入,如图2所示,NeuroLM通过多通道自回归进行训练,即根据可见的EEG token预测下一个EEG token,以使模型具有学习特殊模式的脑电因果关系的能力。

冻结VQ编码器,将EEG转换为对齐文本空间的离散token,扩展LLM词表容纳EEG码本。
- 多通道自回归策略:不同于文本逐token预测,EEG为多通道并行结构,因此每个时间步同时预测所有通道的下一个token;
- 阶梯式注意力掩码:设计特殊掩码,让每个token可观测当前及之前所有时间步的全部通道信息,适配EEG的多通道时空结构;
- 训练中每轮迭代混入少量文本数据,保留LLM原生的语言建模能力。
4.3.3 多任务指令微调
在这一阶段,目标是利用LLMs的力量,将不同的下游数据集作为一个整体进行整合,引入指令调优来处理各种下游任务,如图2所示,为每个下游任务设计专属指令模板,用[SEP]特殊token拼接EEG token与文本指令,实现模态切换。
- 指令分为问答式与多选式两类,具体指令见表3;
- 损失仅计算文本答案部分,不计算EEG与问题部分,稳定训练过程;
- 所有下游任务联合训练,单模型同时学习全部任务。
| 数据集 | 指令描述 |
|---|---|
| TUAB | [SEP] Question: Is this EEG segment abnormal? Answer: {Yes, No} [END] |
| TUEV | [SEP] Question: Which event type does this EEG segment belong to? Options: ( A A A) spike and slow wave. ( B B B) generalized periodic epileptiform discharge. ( C C C) periodic lateralized epileptiform discharge. ( D D D) eye movement. ( E E E) artifact. ( F F F) background. Answer: {( A A A), ( B B B), ( C C C), ( D D D), ( E E E), ( F F F)} [END] |
| SEED | [SEP] Question: Which emotion type does this EEG segment belong to? Answer: {Positive, Neutral, Negative} [END] |
| HMC | [SEP] Question: Which sleep type does this EEG segment belong to? Options: ( A A A) Wake. ( B B B) NREM‑1. ( C C C) NREM‑2. ( D D D) NREM‑3. ( E E E) REM. Answer: {( A A A), ( B B B), ( C C C), ( D D D), ( E E E)} [END] |
| Workload | [SEP] Question: Is this EEG segment of high workload? Answer: {Yes, No} [END] |
| TUSL | [SEP] Question: Which type does this EEG segment belong to? Options: ( A A A) background. ( B B B) seizure. ( C C C) slowing. Answer: {( A A A), ( B B B), ( C C C)} [END] |
4.4 训练与评估
- 硬件环境:8张NVIDIA A100-80G GPU,基于Python 3.11.8+PyTorch 2.2.2+CUDA 12.1实现;
- 分词器训练:共50轮,AdamW优化器,余弦学习率调度,峰值学习率5e-5;
- 自回归预训练:共20轮,峰值学习率6e-4,权重衰减0.1,梯度裁剪阈值为1;
- 指令微调:Base/L版本训练5轮,XL版本训练3轮,大模型采用更低学习率避免过拟合;
- 评估方式:测试时取logits最大值作为预测结果(不使用束搜索),采用平衡准确率、AUC-PR、AUROC、Cohen’s Kappa、加权F1等指标,报告3次随机种子实验的均值与标准差。
5 结果
5.1 多任务整体性能
表4,表5和表6展示了所有的结果,下划线值代表单任务方法的最佳结果,而加粗值代表NeuroLM的最佳结果。



NeuroLM作为多任务统一模型,性能与多数单任务基线方法相当,虽略低于单任务SOTA模型LaBraM,但实现了“单模型执行多任务”的范式突破。
- 模型规模从B提升至XL时,多数下游任务性能持续提升,验证了大参数对EEG表征学习的增益;
- 在极小样本数据集TUSL上,模型性能显得不是很稳定;
- 不同任务数据量不均衡会带来挑战:大数据集与小数据集达到最优性能的训练步长不一致,小样本任务易出现过拟合与性能波动。
5.2 鲁棒性消融
为了验证NeuroLM的鲁棒性,在多任务指令调优阶段,枚举了选项的顺序,并从所有可能的组合中随机选择一个。图3说明了是否对选项进行洗牌的结果。

- 在TUEV和HMC上,与没有洗牌的NeuroLM相比,有洗牌的NeuroLM获得了相当的性能;
- 洗牌操作似乎显著降低了TUSL的性能,这一现象归因于TUSL的数据不足,因为与其他两个数据集相比,TUSL的数据样本数量要少得多。,预计如果给予更多的数据,NeuroLM也会取得类似的结果;
- 总的来说,NeuroLM对任意顺序的选项具有良好的鲁棒性,这表明NeuroLM在预测时确实理解了问题的语言含义。
5.3 指令数据量的消融
使用TUAB,TUEV和HMC数据集来扩展指令数据规模,并验证NeuroLM和其他基线方法的性能,结果如图6所示。

- 结果表明NeuroLM在所有条件下都表现出相似的性能;
- 对于TUAB,NeuroLM、LaBraM和CNN-Transformer表现出稳定的性能;
- 对于TUEV和HMC,只有NeuroLM和LaBraM相对不受数据量变化的影响。
这些发现表明NeuroLM具有鲁棒性,即使在不同的指令数据规模下也能保持较高的性能,突出了其在多任务学习场景中的有效性。
5.4 多通道自回归可视化曲线
图5展示了NeuroLM的预训练损失、准确率和验证困惑度。

- 随着训练的进行,损失稳定收敛,验证困惑度降低,这意味着NeuroLM可以很好地泛化到未见过的EEG数据;
- 参数较多的大模型会获得较小的损失和困惑度;
- NeuroLM-L取得了与NeuroLM-XL相似的验证困惑度,表明当前的预训练数据规模仍无法满足亿级别参数的训练。
5.5 多通道自回归预训练的消融
多通道自回归预训练旨在通过预测每个通道的下一个EEG token来模拟当前的因果LLM,图6展示了多通道自回归预训练对NeuroLM的消融研究。当使用多通道自回归预训练对NeuroLM进行预训练时,表现出显著的性能提升,强调了多通道自回归预训练的有效性。

5.6 时间-频率预测的消融
时域和频域是EEG信号的两个重要方面。为了研究这两个域对于不同下游任务的重要性,通过将神经分词器训练中的重建目标设置为仅时域、仅频域和同时时域和频域(原始NeuroLM)来研究三种变体。图7给出了三种变体之间的对比,发现时域在TUAB、Workload和TUSL上起着更为重要的作用。相反,重构频率成分在TUEV、SEED和HMC上获得了更好的性能,表明频域对于事件分类、情绪识别和睡眠阶段分类具有重要意义。

5.7 EEG和文本嵌入的可视化
为了评估EEG-文本嵌入空间对齐的有效性,使用t-SNE对嵌入进行可视化,结果如图8所示,左半图为不对齐训练神经分词器,右半图用对齐法训练神经分词器。EEG嵌入扩展到文本空间之外而没有对齐的情况下,模型无法预测在多任务指令调优中我们期望的答案,即模型会输出随机单词而不是选项中的( A A A),( B B B)或( C C C)等选项,从而导致下游任务在大多数指标上的得分接近零。这种结果似乎源于注意力评分的混乱,因为EEG和文本嵌入保持在不同的空间。在对齐训练时,EEG空间大多与文本空间对齐,导致指令调优中正常预测,证明了EEG-文本对齐的必要性。

5.8 不同预训练轮次的消融
对不同轮次的预训练模型进行了消融研究,以证明最佳的预训练轮次。如表7、表8、表9所示,使用了5、10、15和20个轮次的预训练模型,加粗表示最佳结果,下划线表示次佳结果。



- 大多数数据集上20轮的预训练获得了最好的结果;
- 在SEED和HMC上,5个迭代次数的模型性能最好;
- 在Workload上,10个迭代次数的模型性能最好;
- 总体而言,更多轮次的预训练可以在不同的任务中获得良好的性能。
6 讨论
6.1 局限性
NeuroLM首次尝试将各种EEG下游任务整合到一个统一的模型中,并在多个下游数据集上取得了有希望的结果。然而,它也存在一些局限性:
- 单任务精度仍有差距:相比针对单数据集端到端微调的SOTA方法,多任务统一模型的单任务性能仍存在一定差距。
- 超参数敏感性较强:模型效果对学习率、训练轮次、数据配比等超参数较为敏感,需精心调参才能获得最优结果。
- 对齐粒度较粗:受限于高质量EEG-文本配对数据的缺失,目前仅实现空间级粗粒度对齐,难以支持细粒度语义理解与生成类任务。
- 数据不均衡挑战:不同下游任务数据量差异可达上千倍,小样本任务易过拟合,多任务联合训练的权重分配仍有优化空间。
6.2 未来工作
- 升级基座LLM:替换为LLaMA 3等更先进的开源大语言模型,进一步提升多任务学习与推理能力。
- 引入混合专家架构:针对EEG与语言的模态差异,设计模态专属专家模块,提升多模态融合效率。
- 细粒度语义对齐:构建EEG-文本描述配对数据集,在分词器阶段引入对比学习损失,实现更细粒度的语义对齐。
- 拓展任务与数据边界:纳入更多类型的EEG任务与更大规模预训练数据,探索零样本、少样本下的新任务泛化能力。
7 总结
NeuroLM是首个将指令微调引入EEG信号处理领域的多任务基础模型,开创性地提出“将EEG视作外语接入LLM”的技术路线,通过文本对齐神经分词器、多通道自回归预训练、多任务指令微调三阶段训练,实现了单模型同时执行多种EEG任务的突破。
该工作打破了传统EEG模型“一任务一微调”的范式,验证了大语言模型范式在脑电信号处理中的可行性与巨大潜力,为通用脑电大模型的发展提供了全新思路,也为后续更高效的脑机接口与医疗健康应用奠定了基础。
更多推荐
所有评论(0)