论文基本信息

Paper: BIOT: Cross-data Biosignal Learning in the Wild
Institution: University of Illinois Urbana-Champaign
Publication: arXiv preprint
Year: 2023
Code: Open Source Code

在这里插入图片描述

1 摘要

论文针对生物信号(如EEG、ECG)数据格式多样、通道不匹配、采样长度不一、缺失值普遍的痛点,提出名为BIOT的通用生物信号编码框架。该模型通过创新的分通道token化策略,将异构生物信号统一转化为“生物信号句子”结构,结合线性Transformer实现跨格式、跨数据集的联合学习与知识迁移。实验在EEG癫痫检测、癫痫分型、脑电异常检测、ECG心律失常分型、人体活动识别等多个任务的结果显示原生BIOT在多数任务上优于现有强基线模型(如CHB-MIT癫痫检测平衡准确率提升约3%);基于多源数据预训练的BIOT模型可进一步带来最高4%的性能增益,证明了“生物信号基础模型+预训练微调”范式的可行性。

2 背景

脑电、心电等生物信号是临床诊断、健康监测的核心数据,现有深度学习模型大多针对特定数据集、特定任务设计,输入格式固定,泛化能力受限。但真实临床场景中,不同设备、不同采集方案会带来三大核心挑战:

  1. 通道不匹配:不同数据集的电极导联数量、位置存在差异;
  2. 长度不统一:样本时长、采样率各不相同;
  3. 缺失值普遍:设备故障、信号伪影会导致通道缺失或片段缺失。

传统方法通过截断/补全对齐长度、插补补齐缺失通道,会引入额外噪声并造成数据分布偏移,损害模型泛化性。受视觉ViT、AST以及大语言模型的启发,论文探索能适配多格式输入的生物信号统一编码模型,支持跨数据源的联合预训练与下游微调,推动生物信号领域基础模型的发展。

3 贡献

与图像、音频或自然语言相比,生理电信号更复杂,主要原因是它有多个通道。将形式多样的生理电信号转换成统一的“句子”结构并非易事。本文提出了BIOT来解决这个问题,它通过一个新颖的生物信号分词(tokenization)模块将每个通道单独分割成词元(token)并展平(flatten),形成一致的生物信号“句子”。主要贡献如下:

  1. 提出通用生物信号 Transformer 架构 BIOT:首次实现了对不同通道数、不同时长、存在缺失值的异构生物信号的统一编码,无需强制对齐输入格式。
  2. 验证跨数据知识迁移能力:支持多源无标注数据联合无监督预训练、跨任务监督预训练,证明了生物信号领域 “预训练 - 微调” 范式的有效性,为生物信号大模型研究提供了可行路径。
  3. 多场景下的优异实证性能:在 EEG、ECG、人体活动感知三大类信号、共 9 个数据集上完成全面评测,标准监督、缺失数据、跨数据迁移等场景下均优于强基线模型。

4 方法

4.1 数据集

论文中一共用到了9组数据集,其中共3组大规模数据用于无监督预训练,共6组数据集用于下游任务评测,覆盖脑电、心电、可穿戴信号三类,数据集的具体可见表1。

表1 数据集统计
数据集信号类型记录数采样率通道数时长样本量任务
SHHS睡眠EEG5445125HzC3‑A2,C4‑A130s5093522无监督预训练
PREST静息EEG6478200Hz16导联10s5110992无监督预训练
CardiologyECG21264500Hz6/12导联ECG10s495970无监督预训练
CHB‑MIT癫痫EEG686256Hz16导联10s326993二分类(癫痫/非癫痫)
IIIC Seizure癫痫EEG2702200Hz16导联10s165309多分类(6种癫痫模式)
TUAB临床EEG2339256Hz16导联10s409455二分类(正常 / 异常)
TUEV临床EEG11914256Hz16导联5s112491多分类(6种脑电事件)
PTB‑XLECG21911500Hz12导联ECG5s65511二分类(心律失常表型)
HARWearable sensors1029950Hz9轴2.56s10299多分类(6种人体动作)

4.2 预处理

前3个数据集(SHHS、PREST、Cardiology)完全用于无监督预训练。接下来的4个数据集(CHB‑MIT 、IIIC Seizure 、TUAB、TUEV)用于监督学习,使用国际10-20系统中常见的16个双极通道(“FP1-F7”,“F7-T7”,“T7-P7”,“P7-O1”,“FP2-F8”,“F8-T8”,“T8-P8”,“P8-O2”,“FP1-F3”,“F3-C3”,“C3-P3”,“P3-O1”,“FP2-F4”,“F4-C4”,“C4-P4”,“P4-O2”)。

对于CHB-MIT(包含23例患者),首先使用患者1至19进行训练,20和21用于验证,22和23用于测试,之后翻转验证集和测试集再次进行实验。对于IIIC Seizure,将患者组按60%:20%:20%分为训练集/验证集/测试集。对于TUAB和TUEV,训练和测试分别由数据集提供,并且进一步将训练患者按80%:20%分为训练组和验证组。对于PTB-XL,将患者组按照80%:10%:10%的比例分为训练集/验证集/测试集。HAR的训练集和测试集已经提供了,并进一步将测试患者按50%:50%划分为验证/测试。

主要的数据预处理步骤可以分为两步:1. 重采样:通过线性插值将所有数据统一到目标采样率(EEG统一为200Hz,ECG统一为500Hz,HAR统一为50Hz),依据奈奎斯特采样定理选取,保证信号有效信息不丢失。2. 归一化:每个通道独立使用其绝对幅值的95%分位数进行归一化,缓解不同通道、不同数据集间的单位与幅度差异。数学上可以理解为对于每个多通道的生物信号 S ∈ R I × J \mathbf{S} \in \mathbb{R}^{I \times J} SRI×J,在其每个通道 S [ i ] \mathbf{S}[i] S[i]上做 S [ i ] percentile ( ∣ S [ i ] ∣ , 95 % ) \frac{\mathbf{S}[i]}{\text{percentile}(|\mathbf{S}[i]|,95\%)} percentile(S[i],95%)S[i]归一化操作。

4.3 模型架构

如图1所示,BIOT编码器级联了两个模块:1. 生物信号Tokenization模块,将任意生物信号分词为一个“句子”结构,这种设计可以潜在地使先前的语言建模技术为当前的生物信号模型赋能。2. 线性Transformer模块,用于捕获“句子”内部复杂的词元交互,同时保持线性复杂度。

在这里插入图片描述

图1 BIOT模型

4.3.1 模块1:生物信号Tokenization

该模块的核心思路是“分通道切片+展平成句”,从根源上解决通道不匹配、长度可变、缺失值问题,具体可见图2展示的两个样本。样本1有4个通道(Fp1、Fp2、O1、O2),持续5秒,模型将每个通道分词成段(segment),然后用三个嵌入(embedding)参数化20个段,通道嵌入中用不同的颜色表示通道(蓝色-Fp1、棕色-Fp2、绿色-O1、黄色-O2)。样本2有通道不匹配(无O2),长度可变(Fp1和Fp2较短)和缺失值(在O1中)问题,使用BIOT仍然可以分词成一个可比较的“句子”。

在这里插入图片描述

图2 生物信号表征

模块1主要可以分为五部分,其中的重采样和归一化已经在4.2 预处理中做了详细说明,接下来主要来分析分通道切片展平成句三重嵌入融合

  1. 分通道切片:对每个通道独立进行切片,切分为时长为 t t t的token,相邻token间可设置 p p p秒的重叠,若信号存在缺失片段,直接丢弃对应token,无需插补。
  2. 展平成句:将所有通道的token按顺序展平,形成长度可变的“生物信号句子”。
  3. 三重嵌入融合:为每个token融合三类嵌入信息。
    片段嵌入:对token做快速傅里叶变换(FFT)提取全频带能量特征,经全连接网络映射为向量,捕捉频域特征;
    通道嵌入:可学习的通道嵌入表,为不同导联添加空间标识;
    位置嵌入:采用正弦余弦相对位置编码,保留时序先后信息,无需额外学习参数。

4.3.2 模块2:线性Transformer

由于多通道生物信号切片后 token 数量多,原生 Transformer 的二次复杂度难以承受,因此采用线性注意力机制,将时空复杂度从 O ( N 2 ) O(N^2) O(N2)降为线性 O ( N ) O(N) O(N),适配长序列生物信号。

在形式上,假设 W K , W V , W Q ∈ R l × k \mathrm{W}^K,\mathrm{W}^V,\mathrm{W}^Q\in\mathbb{R}^{l\times k} WK,WV,WQRl×k K K K矩阵, V V V矩阵和 Q Q Q矩阵,自注意力模块使用降秩参数矩阵 E ⊤ ∈ R N × d \mathbf{E}^{\top}\in\mathbb{R}^{N\times d} ERN×d F ∈ R d × N \mathbf{F}\in\mathbb{R}^{d\times N} FRd×N对softmax注意力( N × N N\times N N×N)进行rank-d近似,输出 H ∈ R N × k \mathbf{H}\in\mathbb{R}^{N\times k} HRN×k

H = A t t e n t i o n ( X W Q , E X W K , F X W V ) = s o f t m a x ( ( X W Q ) ( E X W K ) ⊤ k ) ⏟ N × d ⋅ F X W V ⏟ d × l \begin{aligned} \mathbf{H} & =\mathrm{Attention}(\mathbf{X}\mathbf{W}^{Q},\mathbf{E}\mathbf{X}\mathbf{W}^{K},\mathbf{F}\mathbf{X}\mathbf{W}^{V}) \\ & =\underbrace{\mathrm{softmax}\left(\frac{(\mathbf{X}\mathbf{W}^Q)(\mathbf{E}\mathbf{X}\mathbf{W}^K)^\top}{\sqrt{k}}\right)}_{N\times d}\cdot\underbrace{\mathrm{F}\mathbf{X}\mathbf{W}^V}_{d\times l} \end{aligned} H=Attention(XWQ,EXWK,FXWV)=N×d softmax(k (XWQ)(EXWK))d×l FXWV

模块2的具体架构可见图1的右上部分,主要特点如下:

  1. 基础结构:线性自注意力层+全连接前馈网络,每层前加入层归一化,层间加入残差连接与 Dropout,保证训练稳定与收敛速度。
  2. 输出聚合:对所有token的输出做均值池化,得到整个生物信号样本的全局嵌入表示,实验验证均值池化效果略优于添加分类token。

4.4 训练与应用场景

BIOT编码器可以应用于各种真实世界的生物信号(如图1所示),主要包括:

  1. 标准监督学习:完整格式数据下的分类任务,编码器后接ELU(指数线性单元)激活层与线性分类头,端到端训练。
  2. 缺失数据监督学习:存在通道缺失、片段缺失的场景下,模型结构无需修改,直接适配“标准监督学习”的输入。
  3. 无监督预训练:在多源无标注数据上联合预训练,采用对比学习目标,随机丢弃部分通道与 token 生成扰动信号,通过扰动信号的嵌入预测原信号的嵌入,使用InfoNCE对比损失优化。具体步骤如下:
    – 对原始生物信号 S \mathbf{S} S随机丢弃部分信道和从剩余信道中丢弃部分段,从而形成扰动信号 S ~ \tilde{\mathbf{S}} S~
    – 通过相同的BIOT编码器获得 S \mathbf{S} S S ~ \tilde{\mathbf{S}} S~的嵌入,并在扰动信号嵌入后增加一个预测器(例如两层神经网络),最终获得的 Z \mathbf{Z} Z Z ~ \tilde{\mathbf{Z}} Z~分别是真实嵌入和预测嵌入:
    Z =   B I O T ( S ) , Z ~ =   p r e d i c t o r ( B I O T ( S ~ ) ) \mathbf{Z}=\mathrm{~BIOT}(\mathbf{S}),\tilde{\mathbf{Z}}=\mathrm{~predictor}(\mathrm{BIOT}(\tilde{\mathbf{S}})) Z= BIOT(S),Z~= predictor(BIOT(S~))
    – 对 Z \mathbf{Z} Z Z ~ \tilde{\mathbf{Z}} Z~进行了样本L2正则化后使用交叉熵损失作为对比损失进行优化:
    L =  CrossEntropyLoss ( s o f t m a x ( ⟨ Z , Z ~ ⊤ ⟩ / T ) , I ) \mathcal{L}=\text{ CrossEntropyLoss}\left(\mathrm{softmax}\left(\langle\mathbf{Z},\tilde{\mathbf{Z}}^{\top}\rangle/T\right),\mathbf{I}\right) L= CrossEntropyLoss(softmax(Z,Z~/T),I)
  4. 有监督预训练:在一个标注任务上完成监督训练,再移除分类头、添加新分类头,迁移到格式不同的新任务上微调,实现跨任务知识迁移。

5 结果

5.1 标准监督学习

在多数下游任务上,原生(vanilla)BIOT性能优于SPaRCNet、ContraWR、CNN-Transformer等强基线:

  • EEG任务:CHB-MIT癫痫检测平衡准确率达0.6640,比最优基线提升约3%;IIIC癫痫分型、TUAB异常检测、TUEV事件分类均取得领先或相当水平。
  • ECG与可穿戴任务:PTB-XL心律失常检测、HAR人体动作识别上,BIOT同样超越基线,其中HAR任务提升显著。

基于多源数据预训练的BIOT模型能进一步提升性能,例如6个EEG数据集联合预训练的模型,在CHB-MIT上平衡准确率可达 0.7068。

5.2 缺失数据监督学习

在 TUEV 数据集上模拟“片段缺失、通道缺失、两者同时缺失” 三种场景,结果如图3所示:

在这里插入图片描述

图3 缺失通道或片段的监督学习
  • 所有模型性能随缺失程度提升而下降,但BIOT及预训练BIOT的性能衰减幅度显著小于基线模型,鲁棒性更强。
  • 通道缺失对性能的负面影响大于片段缺失,符合“片段缺失仍保留全通道空间信息”的直觉。

5.3 无监督预训练

  • EEG方向:基于PREST、PREST+SHHS的无监督预训练模型,微调后在4个EEG下游任务上均获得稳定增益,多数据集联合预训练效果优于单数据集预训练。
  • ECG方向:基于Cardiology数据集的无监督预训练模型,在PTB-XL下游任务上同样带来性能提升,12导联预训练效果优于6导联。

5.4 有监督预训练

在不同格式的EEG任务间进行“监督预训练+微调”实验,结果如图4、图5所示:

在这里插入图片描述

图4 从不同的监督预训练模型上对TUEV进行微调

在这里插入图片描述

图5 从不同的监督预训练模型上对CHB-MIT进行微调
  • 任务相关性决定迁移增益:癫痫相关任务(IIIC→CHB-MIT)、同来源数据集(TUAB→TUEV)的迁移效果更显著。
  • 长时数据优于格式对齐:尽管预训练数据格式与目标任务越接近越有利,但更长时长的预训练数据能编码更丰富的时序信息,迁移效果普遍更优。
  • 部分场景下,监督预训练的效果优于无监督预训练。

5.5 全量数据联合预训练

将无监督数据(PREST+SHHS)与4个有监督EEG数据集(CHB-MIT、IIIC Seizure、TUAB、TUEV)结合,训练得到的联合预训练模型,在下游任务上普遍优于单独的无监督或监督预训练模型,达到整体最佳效果。

5.6 消融实验

在这里插入图片描述

图6 目标采样率$r$的消融实验结果

在这里插入图片描述

图7 Token时长$t$的消融实验结果

在这里插入图片描述

图8 重叠时长$p$的消融实验结果

针对三个核心超参数(目标采样率 r r r、Token时长 t t t、重叠时长 p p p)的结论,具体结果如图6、图7、图8:

  1. 目标采样率 r r r:高采样率保留更多高频细节,对癫痫分型等精细任务增益明显;对脑电异常检测等粗粒度任务影响较小,需根据任务特性选取。
  2. Token时长 t t t:token过长会导致句子总长度变短,Transformer建模能力下降,性能衰减;1秒左右的 token 长度综合效果最优。
  3. 重叠时长 p p p:更大的重叠会增加序列长度,同时保留更多时序过渡信息,模型性能有小幅提升。

6 总结

BIOT是生物信号跨数据学习的里程碑式工作,突破了传统模型对固定输入格式的强依赖,首次实现了对异构生物信号的统一Transformer建模,并且首次提出了脑电大模型(EEG Foundation Model)的概念。其“分通道token化+线性Transformer”的设计,为脑电乃至全品类生物信号的基础模型研究提供了核心技术框架。

论文通过多场景、多数据集的充分实验,系统验证了该架构在标准监督、缺失鲁棒、跨数据迁移等场景下的有效性,证明了“大规模预训练+下游微调”范式在生物信号领域的巨大潜力,对后续脑电大模型、临床AI落地都具有重要的参考与奠基意义。

更多推荐