知识图谱与大模型结合综述
#《Bridging data and discovery: a survey on knowledge graphs in AI for science》,
National Science Review (NSR, 2026),由浙江大学、同济大学、上海人工智能实验室等机构的研究者共同撰写。这是一篇关于**科学知识图谱(Scientific Knowledge Graphs, SciKGs)的系统性综述,核心探讨了 SciKGs 如何作为结构化知识基础设施推动 AI for Science,以及与大语言模型(LLMs)**的协同如何开启自主科学发现的新范式。
以下是对该文献的详细解读:
一、研究背景与核心动机
1.1 科学发现的数据困境
现代科学正经历从"直觉驱动"向"数据密集型 AI 驱动"的范式转变。高通量实验、大规模模拟和多模态传感技术产生了前所未有的异构复杂数据。然而:
- 数据碎片化:数据分散在不同格式、术语和领域中;
- 知识鸿沟:数据生成速度远超人类理解和整合能力;
- 利用不足:海量科学知识的潜力远未被充分挖掘。
1.2 科学知识图谱(SciKG)的定位
不同于通用知识图谱(如 Wikidata),SciKG 专为科学领域构建,以有向标记图的形式统一表示科学实体(基因、蛋白质、化合物、材料等)及其语义关系(激活、抑制、结合、催化等)。SciKG 的核心价值在于:
- 将碎片化数据转化为可计算、可推理的结构化知识;
- 作为确定性符号基底,弥补 LLM 的幻觉和不确定性缺陷;
- 支撑跨学科发现,从药物重定位到材料设计。
二、SciKG 的概念基础
2.1 形式化定义
SciKG 定义为有向标记图 G=(V,E)G=(V, E)G=(V,E):
- 节点 v∈Vv \in Vv∈V:科学实体(基因、蛋白质、化合物、反应、材料等);
- 边 e∈Ee \in Ee∈E:实体间的语义关系(激活、抑制、结合、催化、合成等);
- 元数据:节点和边附带来源、实验条件、定量属性、外部数据库链接等;
- 多维扩展:时间维度(知识演化)、上下文维度(实验环境)、多模态维度(文本、数值、图像、光谱)。
关键区分:SciKG 不同于原始科学数据图(如晶体结构图、蛋白质相互作用网络)。数据图关注几何/拓扑结构,而 SciKG 以领域本体为语义骨架,多模态数据作为属性或证据依附于符号知识。
2.2 四大核心角色
| 角色 | 功能描述 |
|---|---|
| 知识组织 | 统一异构数据源(生物序列、化学结构、材料属性、实验记录),提供单点查询入口 |
| 知识嵌入 | 通过 KGE(知识图谱嵌入)将实体和关系投影到连续向量空间,支持药物-靶点预测、材料属性估计等 |
| 知识推理 | 支持链接预测、因果推断、假设生成,发现实验数据中未显式观测的新关联 |
| 知识可解释性 | 保留显式语义关系和可追溯的来源信息,使科学家能验证预测、解释因果链 |
2.3 历史演化(四阶段)
综述将 SciKG 的发展划分为四个时代(见图3):
- 编目时代(2000年前):结构化数据库(GenBank、PDB),关系表存储,支持查找检索;
- 语义网时代(2000-2010):RDF/OWL/SPARQL 兴起,Bio2RDF、OBO Foundry 推动跨库推理;
- 机器学习时代(2010-2020):图嵌入(TransE)和 GNN(GraphSAGE)出现,SciKG 成为预测引擎;
- 大模型时代(2020至今):LLM 与 SciKG 双向协同——LLM 自动化构建 KG,KG 为 LLM 提供事实 grounding,形成"知识-语言"双轮驱动。
三、SciKG 的构建方法论
构建 SciKG 是一个多阶段流程(见图4),包括数据获取、知识抽取、整合表示、动态维护。
3.1 数据源
| 类型 | 示例 | 特点 |
|---|---|---|
| 结构化数据 | PubChem、UniProt、PDB、Materials Project | 标准化、机器可读、持久标识符(DOI、InChI) |
| 非结构化文本 | PubMed、arXiv、专利、实验报告 | 最丰富但最难结构化,需 NLP 抽取 |
| 多模态数据 | 质谱、显微图像、XRD、分子动力学轨迹、NMR | 提供定量上下文,需跨模态对齐 |
3.2 知识抽取技术
| 方法 | 原理 | 优缺点 |
|---|---|---|
| 规则/本体驱动 | 基于领域词典、手工规则、本体(如 Gene Ontology)匹配抽取 | 高精度、可解释,但扩展性差、难以适应新兴概念 |
| 数据驱动 NLP | SciBERT 等科学领域预训练模型,进行 NER、关系抽取、事件检测 | 召回率高、可泛化,但需大量标注 |
| LLM 驱动 | 通过少样本提示或微调,自动识别新实体、推断隐含关系、生成结构化假设 | 强大但存在幻觉风险 |
| 混合/半自动 | 规则预过滤 + 神经网络精修,或神经模型建议新关系 + 本体验证 | 兼顾精度、扩展性和可解释性 |
3.3 整合与表示
- 本体对齐与模式匹配:解决跨源术语差异,采用联邦本体映射和概率模式对齐;
- 图表示学习:
- 浅层 KGE(如 TransE):计算高效,适合大规模关系稠密网络(如药物相互作用),但对未知实体归纳能力差;
- GNN:聚合邻域特征,支持归纳推理,适合结构丰富的分子化学领域;
- LLM-based 编码:捕捉非结构化文本的细粒度语义,零样本能力强但推理延迟高;
- 跨模态嵌入:将文本、图像、分子图、时序数据对齐到共享潜在空间。
3.4 更新与维护
- 增量学习:无缝集成新数据,避免灾难性遗忘;
- 人机协同:专家众包审核(如 UniProt、Gene Ontology 模式);
- LLM Agent 自动化:检测不一致性、矛盾、过时链接,自动传播已验证更新;
- 来源追溯与版本控制:确保可重复性和可信度。
3.5 评估体系
| 层级 | 指标/方法 |
|---|---|
| 组件级 | 实体/关系抽取的 Precision、Recall、F1;本体对齐的正确性 |
| 图级 | 图密度、连通性;链接预测的 MRR、Hits@K |
| 可信度与效用 | 来源覆盖率、时间一致性;下游任务(药物重定位、材料设计)的性能提升 |
四、SciKG 的四大应用领域
综述系统梳理了 SciKG 在四个基础科学任务中的应用(见图1、图5、图6)。
4.1 药物开发与优化
- 药物重定位(Drug Repurposing):KG 整合多组学、文献和通路数据,发现非显而易见的药物-疾病关系。如 TxGNN 在超大规模医学 KG 上预训练,实现对 17,000+ 疾病的零样本预测;
- 药物-药物/药物-靶点相互作用预测(DDI/DTI):异构图捕捉化学相似性、共享靶点和生理效应。DDI-GPT 将 KG 特征与 LLM 结合,实现高精度且可解释的 DDI 预测;
- 虚拟筛选与毒性评估:如 GAMENet 整合 DDI KG 与患者记录推荐安全用药组合;ReproTox-KG 专门构建毒性 KG 预测化合物致畸风险。
4.2 组学解释与分析
涵盖基因组学、转录组学、蛋白质组学、代谢组学、微生物组学:
- 基因组学:整合遗传变异、调控元件和表型数据,进行系统级基因调控机制推断。如 PhenoKG 利用 GNN 直接从患者表型推断致病基因;
- 转录组学:建模配体-受体-靶点通路和 RNA 相互作用网络。如 RNA-KG 整合 60+ 数据库,系统探索"RNA 世界";
- 蛋白质组学:基于元路径分析链接蛋白质与疾病风险基因,支持功能注释和生物标志物验证。如 CKG 整合数百万关系,加速临床蛋白质组数据解释;
- 代谢组学:如 FORUM KG 通过本体推理从实验特征推断新代谢物-疾病关联;
- 多组学整合:将转录组、蛋白质组、代谢组统一为网络,进行系统级建模(如癌症转移预测)。
4.3 化学反应与合成
- 反应预测:分子和反应表示为节点和边,捕捉结构相似性和反应性原理。如 ReaKE 构建化学合成 KG,通过对比学习改进反应分类和产物预测;
- 合成路径优化:整合反应物可用性、催化剂和产率数据,进行多标准推理。如 CatKG 利用词嵌入和掩码语言建模支持催化剂预测和类比推理;
- 分子性质预测:将分子置于链接结构特征、官能团和实验性质的网络中。如 GODE 通过对比学习融合分子图与生化 KG,显著提升性质预测精度。
4.4 材料设计与发现
- 新材料设计:嵌入原子键合、晶体对称性、结构-性能关联等基本原理。如 SciAgents 利用多智能体框架和本体 KG 进行仿生材料生成设计;
- 材料性能预测:整合元素、结构和工艺信息,通过图遍历和逻辑推理预测热导率、机械强度、带隙等。如 PropNet;
- 筛选与优化:整合数据库、文献和实验数据,优先筛选具有目标特性的候选材料。如用于压电材料、超高性能混凝土、COF 气体存储材料等。
五、SciKG 与 LLM 的协同(核心章节)
这是综述最具前瞻性的部分。作者提出 “SciKG 作为知识基础设施,LLM 作为动态语义引擎” 的双向协同框架(见图7、表1)。
5.1 SciKG 为 LLM 提供基础支撑
SciKG 从三个关键维度约束和增强 LLM:
| 维度 | 作用 | 代表工作 |
|---|---|---|
| 事实 grounding 与验证 | 作为权威基准验证 LLM 生成的假设,直接对抗幻觉和事实不一致 | KNOWNET(提取 LLM 输出三元组并映射到 KG 验证)、FactFinder(结构化检索-生成管道) |
| 可解释因果推理的边界 | 防止生成违反科学原理的方案,将 LLM 的生成空间约束在科学有效范围内 | GCR(图约束推理,将 KG 结构直接嵌入 LLM 解码过程,实现零推理幻觉)、Cat-KG(催化 KG 应用专家评分规则约束多步反应路径) |
| 统一多模态表示 | 整合异构数据,使 LLM 能进行跨模态推理和整体分析 | DDI-GPT(融合化学、亚结构和分子数据的多模态 KG) |
此外,SciKG 支持动态知识演化:与需要昂贵重训练的基础模型不同,SciKG 支持增量、低成本的实时更新。
5.2 LLM 作为动态语义引擎
LLM 通过五大核心功能弥补 SciKG 的静态性:
| 功能 | 描述 | 代表工作 |
|---|---|---|
| 语义接口 | 解析复杂 SciKG,将结构化数据转化为自然语言摘要和精确形式查询 | HeCiX(GPT-4 + 生物医学 KG + LangChain) |
| 分析推理器 | 基于 SciKG 的丰富关系结构执行复杂推断和预测 | DDI-GPT(预测 DDI 并生成可解释洞察) |
| 生成引擎 | 产生新颖且合理的假设、实验策略和设计方案 | SciAgents(多智能体系统自主生成生物材料假设)、Ma et al.(大分子自动逆合成规划) |
| 构建者 | 从原始文献和数据中构建、整理和维护 SciKG | iKraph(LLM 处理全部 PubMed 摘要构建大规模生物医学 KG)、KG-RAG(token 高效的知识抽取优化) |
| 编排者 | 管理多步推理流程,协调多智能体系统 | ESCARGOT(动态思维图 + 生物医学 KG,在开放生物医学问题上显著超越标准 RAG) |
5.3 SciKG-LLM 协同赋能的四大科学任务
基于上述互补角色,协同框架系统性地覆盖科学发现全工作流:
- 多源数据解释:SciKG 将海量数据转化为结构化三元组,LLM 提取可解释知识;
- 复杂系统机制分析:SciKG 构建实体-关系网络,LLM 推断因果链(超越传统现象描述);
- 系统性能优化:SciKG 存储变量-性能定量关联,LLM 结合领域约束生成多目标最优解;
- 创新方案设计:SciKG 整合跨领域知识,LLM 通过类比推理生成融合多学科原理的新方案。
这四个任务构成自增强发现反馈循环:数据解释 → 知识丰富 → 机制分析 → 性能优化 → 创新设计 → 实验验证 → 新数据生成。
5.4 迈向自主科学发现范式
综述提出了 “AI Scientist Copilot” 的愿景(见图8),一个嵌入 SciKG-LLM 协同的"感知-认知-执行"闭环系统:
| 阶段 | SciKG 角色 | LLM 角色 |
|---|---|---|
| 从数据到知识 | 提供结构化模式组织提取的信息 | 作为"感知器官"理解文献和多模态数据 |
| 从知识到洞察 | 作为长期记忆和逻辑引擎,验证/精炼因果路径 | 执行类比推理和路径推断,提出假设 |
| 从洞察到发现 | 作为可行性过滤器,确保方案符合已知科学原理 | 作为策略规划者设计实验、合成路线或材料配方 |
物理实现上,这与自主机器人平台(如多智能体驱动的机器人 AI 化学家)结合,形成从计算推理到物理实验的闭环。
六、挑战、机遇与未来方向
6.1 固有局限性
| 局限 | 说明 |
|---|---|
| 连续过程过度简化 | 三元组结构难以捕捉剂量依赖、时间动态、空间定位等连续过程 |
| 认知不确定性与撤稿处理 | 缺乏内置机制表示置信度、冲突假设或负面结果;撤稿信息难以在图中传播 |
| 领域不平衡与偏见 | 文献出版偏见导致"富者愈富"的拓扑结构,热门实体连接密集,冷门领域稀疏 |
6.2 四大技术挑战与对应机遇(见图9)
| 挑战 © | 具体表现 | 机遇 (O) | 解决路径 |
|---|---|---|---|
| C1: 数据质量与完整性 | 数据不完整、噪声、报告偏差、缺失负面结果、格式不一致 | O1: 标准、基准与验证管道 | 建立最小信息标准、标准化本体、基准测试套件、自动化异常检测 |
| C2: 互操作性与整合 | 领域特定本体阻碍跨学科整合;跨学科多义词;数据孤岛(专有壁垒) | O2: 多模态基础模型 | 统一本体框架、联邦知识集成、跨模态对齐、语义翻译、双向知识丰富 |
| C3: 动态与时序知识 | 知识持续演化,但 KG 多为静态;缺乏置信度、冲突证据、撤稿追踪机制 | O3: 基于智能体的自主更新 | AI 科学智能体持续监控文献、增量更新、冲突消解、版本控制、概率图模型 |
| C4: 可信与可解释推理 | 不完整/偏见数据导致误导结论;缺乏形式化不确定性表示;模型不透明 | O4: 可验证的社区治理平台 | FAIR 原则(可发现、可访问、可互操作、可重用)、开放治理、协作策展、审计追踪、可解释模块 |
6.3 三大未来方向
(1) SciKG 自演化框架
将 SciKG 设计为多智能体系统:
- 抽取智能体:从文献、预印本、实验日志中持续挖掘新知识;
- 验证智能体:执行一致性检查、冲突消解、不确定性量化;
- 更新智能体:调整嵌入和时序表示,维护来源和版本控制。
(2) SciKG-LLM 共演化系统
构建紧耦合的迭代双向管道:
- LLM(配备领域提示、RAG、自验证模块)自主提取新实体、关系和假设;
- 知识验证智能体应用概率推理和模式对齐确保一致性后,增量合并入 SciKG;
- SciKG 作为可解释先验 ground 和约束 LLM 推理(图检索增强、神经符号推理、对比知识对齐);
- 共适应反馈机制使两者联合提升:SciKG 为 LLM 提供结构化监督进行持续微调,LLM 重组和修正不一致的图区域。
(3) SciKG 驱动的 AI 科学家智能体
终极愿景:嵌入"感知-认知-执行-反馈"闭环的自主智能体:
- 感知:读取实验/计算数据,编码入 SciKG;
- 认知:基于集成知识进行符号推理和生成式 LLM 推断;
- 执行:规划后续行动(设计新实验/模拟);
- 反馈:强化学习用于动作选择,处理不确定性和冲突证据,连接自动化实验平台(如机器人实验室)。
七、总结
这篇综述的核心论点可以概括为:
科学知识图谱(SciKG)不仅是数据仓库,更是连接数据、知识与智能的确定性符号基底。在 LLM 时代,SciKG 与 LLM 形成"结构-语义"双轮驱动:SciKG 为 LLM 提供事实 grounding、物理约束和可解释性,LLM 为 SciKG 提供动态语义理解、自动构建和生成推理能力。两者的协同正推动科学发现从"人类驱动的假设-验证循环"向"AI 增强的自主发现循环"演进。
综述还建立并维护了一个开放的 SciKG 资源库(GitHub: hicai-zju/scikgs),提供文献、数据集和软件的持续更新,体现了"活综述"(living reference)的理念。
从更宏观的视角看,这项工作描绘了一幅未来科学研究的蓝图:在这个蓝图中,自更新的知识图谱、与 LLM 共演化、并具身于 AI 科学家智能体中的 SciKG 中心生态系统,将成为自主驱动、验证和加速科学发现的核心基础设施。
更多推荐
所有评论(0)