Research Proposal

综合多组学与机器学习揭示了子宫内膜异位症的分子靶点和治疗候选药物

Integrative Multi-Omics and Machine Learning Reveal Molecular Targets and Therapeutic Candidates for Endometriosis

1. INTRODUCTION & JUSTIFICATION OF THE STUDY

1.1 Research Background

子宫内膜异位症(Endometriosis, EMS)是一种雌激素依赖性的慢性炎症性妇科疾病,其病理特征在于具有活性的子宫内膜腺体及间质异位于子宫腔以外的组织器官。作为育龄期女性最常见的良性疾病之一,EMS全球患病率约为10%,而在不孕症女性群体中,患病率可激增至30-50%。该病临床表现多样,以慢性盆腔痛、痛经、性交痛及生育能力下降为核心症状,不仅严重损害患者的身心健康与生活质量,同时也带来了沉重的社会经济负担。据估计,EMS相关诊疗及生产力损失每年给欧美医疗系统造成的经济负担高达数百亿美元,已成为不容忽视的公共卫生问题。

尽管EMS于1860年首次被病理学家Von Rokitansky正式描述,历经一个半世纪的研究探索,其确切发病机制仍未完全阐明。目前被广泛接受的理论框架以Sampson提出的经血逆流学说为核心,辅以体腔上皮化生学说及诱导学说。然而,经血逆流现象在育龄期女性中发生率高达90%,但仅有约10%的个体最终发展为EMS,这一显著的“逆流-患病”差异强烈提示,EMS的发生并非单一机制所致,而是遗传易感性、免疫监视功能失调、局部激素代谢紊乱及微环境炎症改变等多重因素协同作用的结果。此外,EMS病灶的高度异质性(腹膜型、卵巢型、深部浸润型)进一步增加了机制解析的复杂性,使得传统单一分子或单一通路的研究范式难以系统揭示其病理生物学全貌。

在临床诊疗层面,EMS面临着诊断延迟与治疗手段局限的双重困境。目前诊断金标准仍为腹腔镜检查,这一有创操作不仅费用高昂,且存在手术风险,导致患者从症状出现到最终确诊的平均延迟时间长达7-10年,期间病情进展与痛苦积累严重影响着患者的生育结局与生活质量。治疗策略方面,现有临床常用药物主要包括非甾体抗炎药、口服避孕药、孕激素及促性腺激素释放激素激动剂,其核心作用机制均围绕抑制卵巢激素分泌、诱导病灶萎缩展开。然而,这类激素干预策略仅能暂时缓解症状,无法根除病灶,停药后5年复发率高达40-50%;长期使用还伴随着骨质流失、肝功能损伤及更年期症状等显著不良反应,尤其对于有生育需求的患者,现有治疗方案更是面临治疗窗口与生育保护之间的矛盾。

综上所述,EMS复杂的发病机制、有限的诊断手段及不满足于现状的治疗方案,共同构成了临床管理的核心挑战。因此,整合系统生物学与人工智能方法,深入解析EMS的分子调控网络,筛选具有诊断价值的生物标志物,并开发靶向非激素通路的新型治疗药物,已成为突破当前诊疗瓶颈、实现精准医学转化的关键路径。

1.2 Problem Statement

在EMS研究领域取得诸多进展的同时,临床诊疗仍面临多重瓶颈:

第一,发病机制复杂且异质性高。 EMS是一种高度异质性的疾病,其临床表现、病灶部位、激素反应及治疗预后存在显著个体差异。传统的单一分子或单一通路研究难以全面解析其复杂的病理生物学网络。

第二,缺乏无创诊断标志物。 目前临床尚无高灵敏度、高特异度的无创诊断方法,导致患者长期遭受误诊或延迟诊断的痛苦,错失最佳干预时机。

第三,现有治疗策略存在局限性。 激素类药物仅能暂时抑制症状,停药后复发率高,且长期使用可能导致骨质流失、肝功能损伤等不良反应。对于有生育需求的患者,现有治疗方案更是面临两难选择。

1.3 Research Gap

基于对现有文献的系统梳理,本研究识别出以下主要研究空白:

第一,多组学整合分析的缺乏。 现有EMS转录组研究多局限于单一数据集或单一组学分析,样本量有限,且未充分整合不同平台的公共数据,导致结果可重复性差、统计效能不足。缺乏系统性的多数据集整合与批次效应校正策略。

第二,机器学习模型的可解释性不足。 近年来,机器学习在生物医学领域的应用日益广泛,但多数研究侧重于模型预测性能的提升,而忽视了模型的可解释性。黑箱模型难以揭示特征基因与疾病表型之间的生物学关联,限制了其在临床转化中的应用价值。

第三,药物筛选缺乏多维度验证。 目前基于生物信息学的药物筛选多止步于分子对接,缺乏对蛋白-配体结合稳定性的动态评估,也较少结合ADMET属性进行药物可行性的系统评价。

1.4 Research Questions (RQ) and RQ-RO-Method Matrix

基于上述研究空白,本研究提出以下核心研究问题:

研究问题 (RQ)研究目标 (RO)核心方法
RQ1: 哪些基因在EMS中表达失调,可作为潜在的诊断生物标志物?RO1: 系统识别EMS相关差异表达基因及共表达模块,并通过可解释机器学习筛选核心枢纽基因。多数据集整合分析、limma、WGCNA、多算法机器学习、SHAP可解释性分析
RQ2: 筛选出的枢纽基因参与哪些生物学过程,其与EMS风险是否存在因果关联?RO2: 解析枢纽基因的功能注释、转录后调控网络,并基于孟德尔随机化方法验证其与EMS的因果关系。GO/KEGG富集分析、TRUST转录因子预测、miRNA网络构建、SMR分析、HEIDI检验
RQ3: 基于枢纽基因能否筛选出具有治疗潜力的候选药物?RO3: 通过AI驱动化合物筛选及多尺度分子模拟,识别并验证潜在治疗药物的结合稳定性。药物富集分析、ADMET预测、分子对接、分子动力学模拟

1.5 Significance of the Study

本研究的科学价值与临床意义主要体现在以下几个方面:

(1)理论创新:构建EMS分子调控网络全景图。 通过整合多组学数据与系统生物学方法,本研究将构建EMS的分子调控网络,揭示关键基因、信号通路及调控轴之间的交互作用,为深入理解EMS发病机制提供新的理论视角。

(2)方法创新:建立可解释的AI驱动靶点发现框架。 本研究将可解释人工智能引入生物标志物筛选流程,不仅关注模型的预测性能,更注重揭示特征基因的贡献机制,为生物信息学与人工智能的深度融合提供范式参考。

(3)转化价值:提供经过多维度验证的候选化合物。 通过药物富集分析、AI可行性评估及多尺度分子模拟,本研究将筛选出兼具结合活性、稳定性及药物相似性的候选化合物,为EMS的新药研发提供直接的候选分子和理论依据。

1.6 Scope and Limitations

研究范围:
本研究聚焦于子宫内膜异位症的转录组层面分析,主要利用公共数据库中的基因表达芯片数据及单细胞测序数据。研究范围涵盖差异表达分析、共表达网络构建、机器学习特征筛选、功能注释、因果推断、药物筛选及分子模拟。研究对象限定为异位病灶组织与正常子宫内膜组织的比较

研究局限性:
本研究存在以下潜在局限性,需在结果解读时予以考虑:

(1)数据来源的固有偏倚。 本研究所有数据均来源于公共数据库,样本采集、平台差异及临床信息的完整性不受控制,可能引入一定的偏倚。

(2)缺乏湿实验验证。 作为一项计算生物学研究,本研究识别的枢纽基因及候选化合物尚需通过体外细胞实验及动物模型进行功能验证,以确认其在EMS发生发展中的确切作用及治疗效果。

(3)样本异质性的影响。 子宫内膜异位症病灶具有高度异质性(如腹膜型、卵巢型、深部浸润型),受限于公共数据的临床注释信息,本研究未对不同亚型进行分层分析。

2. LITERATURE REVIEW

基于第一章提出的研究空白与研究问题,本章对子宫内膜异位症(EMS)相关研究领域进行系统文献综述。综述围绕三个核心主题展开:**EMS的分子机制与多组学研究现状、**机器学习在EMS生物标志物筛选中的应用、以及基于生物信息学的药物筛选与分子模拟研究。通过对现有文献的系统梳理,进一步明确本研究的创新定位与学术价值。

2.1 子宫内膜异位症的分子机制与多组学研究进展

2.1.1 EMS的分子病理机制

子宫内膜异位症是一种雌激素依赖性的慢性炎症性疾病,其发病机制涉及遗传易感性、激素代谢异常、免疫失调、氧化应激及表观遗传修饰等多重因素。研究表明,EMS患者异位病灶中呈现显著的激素代谢紊乱,主要表现为局部雌激素优势及孕激素抵抗。雌激素受体1(ESR1)表达上调可促进细胞黏附、增殖及血管生成,从而驱动异位病灶的生长;芳香化酶作为雌激素合成的关键酶,在异位病灶中异常高表达,导致局部雌激素水平升高。与此同时,孕激素受体(PGR)及孕激素反应基因的表达下调,导致病灶部位的孕激素抵抗,影响子宫内膜的正常周期性更新。

在炎症与免疫调控层面,EMS异位病灶中多种炎症介质表达显著升高,包括环氧合酶-2(COX-2)、白介素-1β(IL-1β)、IL-6、IL-8、IL-17、前列腺素E2(PGE2)及肿瘤坏死因子-α(TNF-α)等。这些炎症介质通过复杂的相互作用网络,加剧局部炎症反应,促进病灶的黏附、侵袭及血管生成。多项研究证实EMS与氧化应激密切相关:活性氧(ROS)的异常积累可对细胞结构及功能造成广泛损伤,被认为是启动炎症反应、细胞外基质重塑、血管生成及细胞增殖的关键因素。

近年来,表观遗传调控在EMS发病机制中的作用日益受到关注。研究显示,EMS异位基质细胞中存在广泛的表观遗传异常,包括DNA甲基化改变、组蛋白修饰及微小RNA(miRNA)表达失调。这些表观遗传改变可影响关键基因的表达,进而调控细胞增殖、凋亡、分化及炎症反应。

2.1.2 EMS研究的单组学局限与多组学整合趋势

上述研究为理解EMS的分子机制提供了重要线索,但传统单一分子或单一通路的研究范式存在显著局限。EMS是一种高度异质性的疾病,其临床表现、病灶部位、激素反应及治疗预后存在显著个体差异。深部浸润型EMS(DIE)可能引起肠道或泌尿系统症状,而卵巢型子宫内膜异位囊肿则更常与痛经相关,提示EMS的分子病理机制可能涉及多个生物学层面的复杂交互网络。

多组学整合分析逐渐成为EMS研究的新范式。Science Direct发表的综述强调,运用多组学整合分析揭示复杂疾病的分子网络并识别关键生物标志物,是当前研究的重要方向。通过整合基因组、转录组、表观基因组、蛋白质组及代谢组数据,可系统解析EMS的病理生物学全貌,突破单一组学研究的局限性。

在代谢重编程领域,Hereditas发表的研究通过整合GEO多数据集及Genecards数据库,识别了107个EMS相关的代谢重编程候选基因,并通过WGCNA及PPI网络分析筛选出HNRNPR、SYNCRIP、HSP90B1等10个核心基因。该研究通过外部数据集及临床样本验证,证实CCT2、HSP90B1、SYNCRIP在EMS病灶中表达下调,具有较高的诊断价值(AUC > 0.8)。在细胞衰老领域,PMC发表的SMR研究整合了GWAS、eQTL、mQTL及pQTL数据,识别了78个基因中的196个CpG位点与EMS存在因果关联,确认THRB基因及ENG蛋白为EMS的风险因子。

现有研究已证实EMS的分子机制涉及多层面的复杂调控网络,但系统性的多组学整合分析仍相对缺乏,特别是将转录组、表观组及蛋白质组数据进行联合挖掘的研究尚不多见。现有研究多局限于单一数据集分析,样本量有限,结果可重复性有待提高,为本研究的第一个研究问题提供了明确的研究空间。

2.2 机器学习在EMS生物标志物筛选中的应用

2.2.1 机器学习在疾病诊断中的应用范式

机器学习作为人工智能的核心分支,通过从医疗记录和既往经验中学习,能够对数据进行分类或预测。监督学习基于已标记的数据集训练算法,常用于诊断场景中的回归和分类任务;无监督学习识别数据中的隐藏模式或聚类,对于发现临床医生可能不易察觉的表型或疾病亚型具有重要价值;深度学习采用多层神经网络自动提取特征并识别复杂模式,在医学图像和信号分析领域表现尤为突出。在妇科领域,机器学习已广泛应用于癌症诊断、风险评估及临床决策支持。

2.2.2 机器学习在EMS生物标志物筛选中的研究现状

机器学习在EMS研究中的应用日益增多,主要通过症状聚类和影像整合实现早期无创诊断。在症状聚类方面,无监督机器学习算法如k-means、PAM及贝叶斯网络,已成功从患者报告症状和电子健康记录中识别出具有临床意义的EMS表型。在影像整合方面,卷积神经网络和影像组学方法在影像数据病灶检测中取得了较高准确性。

基于转录组数据的生物标志物筛选方面,International Journal of Women’s Health发表的研究采用13种机器学习算法构建了107个诊断模型,基于GSE141549数据集筛选出CEACAM1、FOS、PLA2G2A和THBS1四个与中性粒细胞胞外诱捕网相关的核心基因。该四基因诊断模型在训练集中表现卓越(AUC = 0.962),在10折交叉验证中平均AUC达0.975,并在外部验证集中证实了模型的稳健性。

Precision and Future Medicine发表的综述系统梳理了机器学习在EMS诊断中的应用进展与挑战。该综述指出,机器学习在EMS研究中展现出巨大潜力,但仍面临多重挑战,包括缺乏大规模、标注完善的多模态数据集,缺乏广泛接受的评估标准,以及模型可解释性和泛化能力方面的担忧。通过多中心整合研究及引入可解释性技术,可作为应对这些挑战的潜在策略。

2.2.3 可解释人工智能与模型可解释性的重要性

传统机器学习模型常被视为“黑箱”,难以揭示特征基因与疾病表型之间的生物学关联,限制了其在临床转化中的应用价值。可解释人工智能(XAI)应运而生,旨在使模型决策过程透明化、可理解化。SHAP(SHapley Additive exPlanations)是目前应用最广泛的模型可解释性方法之一,通过量化每个特征对模型输出的贡献,帮助研究者理解模型的决策依据。

在EMS研究领域,将可解释人工智能引入生物标志物筛选流程的研究尚处于起步阶段。现有研究多侧重于模型预测性能的提升,而忽视了对特征基因贡献机制的深入解析,为本研究的第二个研究问题提供了明确的研究空间。

机器学习在EMS生物标志物筛选中的应用已取得初步进展,但仍存在多算法集成策略应用尚不充分、模型可解释性分析相对缺乏、筛选结果的因果验证不足等问题。本研究拟通过构建涵盖127种算法的多模型机器学习框架,结合SHAP可解释性分析及SMR因果推断,系统填补上述空白。

2.3 基于生物信息学的药物筛选与分子模拟研究

2.3.1 药物重定位与计算药物筛选

药物重定位是指发现已批准药物或候选药物新适应症的策略,具有研发周期短、成本低、风险小的优势。在EMS领域,由于新药研发周期长、失败率高,药物重定位策略具有重要的临床转化价值。

Cell Biochemistry and Biophysics发表的研究采用多尺度计算方法,针对子宫内膜异位症向子宫内膜癌转化的关键靶点ICAM1进行了系统的药物筛选。该研究通过转录组分析识别了EMS与子宫内膜癌共有的108个上调基因,通过蛋白质相互作用网络分析确定ICAM1为核心分子。研究者基于已知ICAM1抑制剂生成了基于配体的药效团模型,筛选了1739种抗癌药物,筛选出421种具有ICAM1抑制药效团特征的药物。分子对接显示,兰瑞肽与ICAM1的结合亲和力(-7.80 kcal/mol)优于参考ICAM1抑制剂(-3.59 kcal/mol)。结合自由能计算及动力学模拟证实,兰瑞肽-ICAM1复合物具有较高的结合亲和力(-55.90 kcal/mol)及稳定的构象。

2.3.2 药物富集分析与AI驱动化合物筛选

基于核心基因的药物富集分析是连接生物标志物筛选与药物发现的桥梁。DSigDB是常用的药物富集分析数据库,可将核心基因集与已知药物的作用靶点或表达谱特征进行匹配,识别潜在的候选药物。单纯基于富集分析的筛选结果需进一步结合药物相似性评估及分子模拟验证,以提高筛选的准确性。

在药物可行性评估方面,Lipinski五规则、Veber规则及Ghose规则是评估化合物类药性的经典标准。QED可量化化合物的药物相似程度,合成可及性评分评估化合物的合成难易程度。ADMET预测涵盖吸收、分布、代谢、排泄及毒性等关键药代动力学属性,是药物筛选的重要环节。PAINS及BRENK结构警示则用于排除可能产生假阳性结果的干扰化合物。现有研究较少将这些多维评估指标系统整合,构建标准化的化合物分级筛选流程。

2.3.3 分子对接与分子动力学模拟的研究现状

分子对接是预测小分子配体与蛋白质靶点结合模式和亲和力的常用方法。Smina作为Vina评分函数的优化版本,在对接精度和计算效率方面具有优势。在EMS研究领域,分子对接已广泛应用于靶点-配体相互作用的预测。分子对接基于刚性受体或半柔性配体的假设,难以完全模拟生理条件下蛋白-配体复合物的动态行为。

分子动力学模拟可弥补分子对接的静态局限,通过计算复合物在设定时间内的原子运动轨迹,评估其结合稳定性、构象变化及相互作用动态。常用力场包括AMBER、CHARMM及GROMACS等。Hereditas发表的研究指出,结合自由能计算及动力学模拟可有效验证分子对接结果的可靠性。Mahema等人的研究通过100 ns的分子动力学模拟,验证了兰瑞肽与ICAM1复合物的稳定性,为候选药物的筛选提供了有力支持。

现有EMS药物筛选研究存在筛选流程不完整、评估维度单一、缺乏分级筛选标准等不足,为本研究的第三个研究问题提供了明确的研究空间。

2.4 研究空白与本研究定位

综合上述文献综述,当前EMS研究领域存在以下核心空白:多组学整合分析的缺乏,现有EMS转录组研究多局限于单一数据集或单一组学分析,样本量有限,结果可重复性差,系统性的多数据集整合与批次效应校正策略仍有待完善;机器学习模型的可解释性不足,多数研究侧重于模型预测性能的提升,而忽视了模型的可解释性,黑箱模型难以揭示特征基因与疾病表型之间的生物学关联;药物筛选缺乏多维度验证,现有基于生物信息学的药物筛选多止步于分子对接,缺乏对蛋白-配体结合稳定性的动态评估,较少结合ADMET属性进行药物可行性的系统评价。

本研究拟整合5个GEO数据集,通过严格的批次效应校正及多维度验证,提高筛选结果的稳健性;构建涵盖127种算法的多模型机器学习框架,结合SHAP可解释性分析及SMR因果推断,突破现有研究的局限;整合药物富集分析、AI可行性评估、分子对接及100 ns分子动力学模拟,构建完整的药物筛选与验证流程。

综上所述,本研究通过整合多组学分析、可解释机器学习及多尺度分子模拟,系统识别EMS的分子靶点与治疗候选药物,具有明确的理论创新与方法学价值。

3. RESEARCH METHODOLOGY

3.1 Data Collection and Analysis

从GEO数据库检索并下载了5个与子宫内膜异位症(Endometriosis, EMS)相关的基因表达数据集,分别为GSE25628、GSE31683、GSE35287、GSE37837和GSE44207。为消除不同芯片平台及实验条件引入的批次效应,采用R语言sva包(版本3.58.0)中的ComBat算法对合并后的数据进行批次效应校正,并通过主成分分析(PCA)对校正效果进行可视化评估。将GSE25628、GSE31683和GSE35287合并作为训练集,GSE37837和GSE44207则作为独立外部验证集。所有表达矩阵均进行log2转换,并使用limma包(版本3.66.0)中的normalizeBetweenArrays函数进行标准化处理,以确保数据间的可比性。

3.2 Differentially expressed genes (DEGs) in the training set

基于整合后的训练集(GSE25628、GSE31683和GSE35287),采用limma包筛选EMS样本与正常对照样本之间的差异表达基因。筛选阈值为|log₂ Fold Change| > 0.585(即倍数变化大于1.5倍)且校正后P值(FDR)< 0.05,该阈值设定兼顾了差异表达的生物学意义与统计学显著性。

3.3 Weighted gene co-expression network (WGCNA) analysis of DEGs

采用WGCNA包(版本1.73)构建基因共表达网络。为保证网络符合无标度拓扑特性,软阈值功率选定为β=6(对应的拟合指数R² > 0.90)。基于拓扑重叠矩阵(TOM)进行层次聚类,通过动态树切割算法识别基因模块(最小模块规模设置为50),并合并高度相关的模块(模块特征基因相关系数> 0.25)。通过计算模块特征基因与临床表型的相关性,筛选出与EMS显著相关的模块(|相关系数| > 0.6,p < 0.001)。进一步提取模块中同时满足高基因显著性(|GS| > 0.4)和高模块内连通性(|MM| > 0.8)的基因,将其与DEGs取交集,获得候选基因集用于后续蛋白质-蛋白质相互作用网络分析。

3.4 PPI analysis of DEGs

基于STRING数据库(版本11.0,交互评分阈值≥400)构建蛋白质-蛋白质相互作用网络。采用全局中心性分析方法,计算每个节点的五个中心性指标,包括度中心性、介数中心性、紧密度中心性、特征向量中心性和PageRank值。对各指标进行Z-score标准化后,按照权重系数(0.25/0.25/0.20/0.15/0.15)加权计算综合评分,筛选综合评分排名前30的基因作为机器学习模型构建的核心候选集。同时,计算网络拓扑参数,包括网络密度、平均路径长度和聚类系数,并绘制中心性分布图、基因表达热图、PPI网络图以及高强度相互作用弦图。

3.5 Feature selection and hub gene identification based on integrated ML and SHAP algorithm

将PPI网络分析获得的30个候选基因纳入多模型机器学习框架。该框架涵盖正则化模型、广义线性模型、集成学习方法、模式识别模型及多类梯度提升方法在内的127种算法,以全面探索模型性能。建模过程采用递归特征消除进行变量筛选,并运用堆叠泛化策略构建多模型预测系统。所有候选模型均在分层10折交叉验证环境下进行超参数优化与拟合。采用SHAP方法量化特征对模型输出的贡献,结合kernelshap(版本0.9.1)和shapviz(版本0.10.3)包实现模型可解释性分析。通过自定义优化预测函数进行自助重抽样(n = 100),计算各特征的平均SHAP值及其95%置信区间。基于表现最优的模型筛选关键基因,并在训练集和外部验证集中验证其表达稳定性。根据ROC曲线下面积(AUC)确定最终的枢纽基因。

3.6 Functional annotation and transcription factor regulatory analysis

基于通过机器学习筛选的核心基因,进行了系统的功能注释和机制分析。使用R包“clusterProfiler”和“DOSE”(版本4.4.0)对基因进行了GO功能注释和KEGG通路富集分析,以探索它们在乳腺癌生物过程、分子功能、细胞组分和信号通路中的潜在作用。为了进一步解析它们在乳腺癌中的可能转录调控机制,通过TRUST v2数据库(www.grmpedia.org/trust;访问日期:2026年01月1日)预测与核心基因相互作用的转录因子,并筛选出数据库中得分最高的前10个转录因子作为候选上游调节因子。

3.7 Immune infiltration assessment and microRNA regulation analysis

CIBERSORT算法被用于基于线性支持向量回归对BC表达矩阵进行解卷积(https://cibersortx.stanford.edu/),以获取涵盖多种先天和适应性免疫细胞群体的22种免疫细胞类型的相对丰度信息,并评估中心基因与关键免疫细胞类型之间的关联模式。

评估了中心基因与关键免疫细胞类型之间的关联模式,并通过miRDB数据库(http://www.mirdb.org)预测了与中心基因相互作用的候选微小RNA。构建了miRNA-mRNA调控网络,以揭示BC进展的关键转录后调控轴。

3.8 SMR-based causal inference analysis of gene expression-EMS risk

为了在基因水平上验证核心基因与EMS风险的因果关联,进一步使用FinnGen全基因组关联研究(GWAS)聚合数据,并进行了标准化和预处理,以生成基于表达定量性状位点的孟德尔随机化分析的SMR输入格式,并结合eQTLGen的顺式eQTL数据。分析采用了双重筛选框架:使用FDR校正阈值(p_SMR < 0.05)来识别显著信号,然后与HEIDI检验(p_HEIDI > 0.05)结合,以排除由于连锁不平衡造成的假阳性,从而获得支持与EMS风险共享的因果变体的候选基因。为核心基因绘制了效应散点图的SMR区域图,并基于全基因组结果生成了曼哈顿图,以展示表达调控与疾病风险之间的因果结构。

3.9 Single-cell spatial transcriptome data analysis and hub genes expression validation

本研究基于EMS单细胞RNA测序数据集GSE186344,使用Seurat(版本5.3.1)进行了系统分析。原始UMI矩阵经过质量控制,以保留高质量细胞,要求基因数>200且线粒体基因<15%,并使用LogNormalize方法进行归一化。随后,进行了PCA降维,并使用Harmony校正样本之间的批次效应,基于前20个主成分构建了k近邻图,并在0.6的分辨率下进行了聚类。使用SingleR(版本2.12.0)进行细胞类型注释,参考HumanPrimaryCellAtlas数据集进行自动细胞身份注释。为识别的中心基因绘制了FeaturePlot、VInPlot和DotPlot,以评估它们在不同细胞亚群中的表达特征,并比较肿瘤与正常组织之间的表达差异。

3.10 Drug enrichment analysis based on DSigDB and Al-driven compound screening

基于筛选出的中心基因,使用ClusterProfiler (v4.18.2) 对DSigDB进行了药物富集分析(p < 0.05,FDR < 0.05),以获取与基因表达模式相关的小分子。随后,构建了一个基于人工智能的自动化药物可行性评估系统,以计算候选化合物的关键物理化学描述符,并整合Lipinski、Veber和Ghose规则,结合QED、合成可及性评分(SA评分)、基于规则的ADMET预测以及PAINS/BRENK结构警报,构建了一个多维加权模型(总分0-1)。根据整体评分将化合物分级为A到F,仅选择A级化合物进行后续的分子对接分析。

3.11 Molecular docking and protein-ligand interaction analysis

对于通过筛选获得的A级候选化合物,采用Smina软件(基于Vina评分函数)进行灵活配体-刚性受体的分子对接。用于对接的蛋白质结构从RCSB PDB数据库中筛选,筛选标准包括:物种来源为人类、采用X射线晶体衍射解析、分辨率<3.0 Å、为单链结构,且含有分子量>100 Da的共结晶配体。所有蛋白结构均在pH 7.4条件下进行质子化处理,并使用OpenBabel(版本3.1.1)转换为PDBQT格式。对接结合口袋依据原共结晶配体的空间位置定义,在其周围构建边长为4.0 Å的对接网格盒,对接过程的穷举性参数设置为16。所有对接任务均在自动并行优化环境中运行。对接完成后,通过计算对接配体与其共晶构象之间的均方根偏差(RMSD < 2.0 Å)进行重对接验证,以确保对接参数的可靠性。随后,基于PyMOL(版本2.5.0)API,依照PLIP标准系统识别氢键(距离<3.5 Å)、盐桥(<5.5 Å)、疏水相互作用(<4.0 Å)及π-π堆积作用(<5.5 Å),并生成三维可视化图谱以解析候选化合物与靶蛋白的关键结合模式。

3.12 Molecular dynamics simulation

为进一步评估最优对接复合物的结合稳定性及动态行为,采用GROMACS(2022.3版本)软件包进行分子动力学模拟。蛋白-配体复合物结构经筛选后,选用AMBER99SB-ILDN力场进行蛋白质参数化,配体分子则通过GAFF(General Amber Force Field)力场进行参数化,并使用RESP(Restrained Electrostatic Potential)方法在HF/6-31G*水平下拟合部分电荷。将复合物置于TIP3P水模型的立方体周期性水盒子中,复合物与盒子边界的最小距离设置为1.0 nm。为中和体系电荷,加入适当数量的Na⁺或Cl⁻离子。在模拟开始前,采用最陡下降法对体系进行能量最小化,以消除不良空间接触。随后,在恒定粒子数、体积和温度(NVT)系综下,将体系逐步升温至300 K,进行100 ps的温度平衡;继而在恒定粒子数、压强和温度(NPT)系综下进行100 ps的压强平衡,压强控制为1 bar。最后,在无任何约束条件下进行100 ns的成品模拟,积分步长设为2 fs。模拟过程中,温度通过V-rescale温度耦合方法控制,压强则通过Parrinello-Rahman方法维持。长程静电相互作用采用PME(Particle Mesh Ewald)算法计算,非键相互作用的截断值设为1.0 nm。所有键长采用LINCS算法进行约束。模拟结束后,利用GROMACS内置工具分析轨迹的均方根偏差(RMSD)、均方根波动(RMSF)、回旋半径(Rg)及氢键数量,以综合评价复合物在模拟期间的构象稳定性、残基柔性及结合亲和力变化。

4. EXPECTED RESEARCH OUTCOMES

基于本研究设计的技术路线与方法框架,预期获得以下研究成果:

(1)识别EMS相关的核心枢纽基因集

通过整合多数据集差异表达分析、WGCNA共表达网络构建及多算法机器学习筛选,预期获得2-4个具有稳定诊断效能的核心枢纽基因。这些基因将在训练集和外部验证集中进行验证,并以ROC曲线下面积(AUC)量化其区分EMS患者与正常对照的能力。

(2)阐明枢纽基因的生物学功能与调控机制

通过GO/KEGG富集分析、转录因子预测及miRNA网络构建,预期揭示枢纽基因参与的生物学过程及信号通路,并识别其潜在的上游调控因子。通过SMR孟德尔随机化分析,预期验证至少1个枢纽基因与EMS风险存在因果关联,为其作为治疗靶点提供遗传学证据。

(3)获得具有治疗潜力的候选化合物及分子互作证据

基于枢纽基因的药物富集分析及AI驱动的化合物可行性评估,预期筛选出3-5个A级候选化合物。通过分子对接及100 ns分子动力学模拟,预期获得至少1个结合稳定、构象可靠的蛋白-配体复合物,并明确其关键结合模式与相互作用位点。

(4)完成博士大论文及发表2篇SCI论文

基于上述研究成果,完成题为《综合多组学与机器学习揭示子宫内膜异位症的分子靶点和治疗候选药物》的博士学术论文。同时,将研究内容分解为以下2篇SCI论文进行发表:

  • 论文一:基于多组学整合与机器学习的子宫内膜异位症诊断生物标志物筛选及验证
  • 论文二:子宫内膜异位症治疗候选药物的计算筛选及分子模拟研究

5. PROPOSED WORK SCHEDULE - THREE-YEAR PhD TIMELINE

时间段主要研究任务预期产出
第1年文献调研与数据准备完成文献综述;完成GEO数据下载、整理及预处理;确定分析流程与技术参数
第1-3月系统文献检索与阅读,撰写文献综述初稿文献综述框架;第一章、第二章初稿
第4-6月GEO数据集的检索、下载及质量控制5个数据集的原始数据及临床信息
第7-9月批次效应校正、数据标准化及PCA验证处理后的表达矩阵;校正前后的PCA图
第10-12月差异表达分析及WGCNA共表达网络构建DEGs列表;关键模块及候选基因集;第三章初稿
第2年核心分析与论文撰写完成主要计算分析;完成第一篇SCI论文初稿
第13-15月PPI网络构建及多中心性分析候选基因综合评分排名;PPI网络图
第16-18月多模型机器学习框架构建与SHAP分析枢纽基因集;模型性能指标;SHAP贡献图
第19-21月功能富集、转录因子预测及miRNA网络构建GO/KEGG结果;TF-miRNA-mRNA网络图
第22-24月SMR因果推断分析因果关联基因;SMR散点图;第一篇SCI论文初稿完成
第3年药物筛选与大论文撰写完成药物筛选分析;完成第二篇SCI论文及大论文
第25-27月单细胞转录组验证分析枢纽基因的细胞类型定位;FeaturePlot/VlnPlot
第28-30月药物富集分析、AI可行性评估及化合物分级候选化合物列表;A级化合物筛选结果
第31-33月分子对接及100 ns分子动力学模拟结合模式图;RMSD/RMSF/Rg轨迹图;第二篇SCI论文初稿完成
第34-36月大论文整合、润色、投稿及答辩准备博士大论文全文;SCI论文投稿;答辩PPT

REFERENCES

更多推荐