引言:AI4S 需要什么样的 Agent?

项目地址:https://github.com/kakastudy/colulu-agents-main
过去两年,"AI for Science"从概念走进了真实世界——AlphaFold 破解蛋白质折叠、AI 驱动的药物分子筛选进入临床、大模型加速材料设计……但在这些宏大叙事背后,每一位科研工作者都清楚,真实的科研流程远比想象中琐碎。

一个典型的场景:计算化学研究者发现文献中某模型存在改进空间。他需要检索上百篇文献并交叉验证方法学、设计对照组实验、预估样本量与统计功效、编写并长时运行计算脚本(动辄数小时甚至数天)、将数字预测与物理实验结果逐点比对、根据失败结果修正假设——如此循环往复,直到结论成立。最后,还要把这一切打包成一篇图表可复现、结论可追溯、符合投稿规范的论文。

这背后是三个长期被 AI4S 讨论忽视的硬需求:

  • 长时:科研计算不是"问一句、答一句",而是数小时到数天的长程运行,需要检查点、监控面板与断点续跑;
  • 反馈:干实验(计算)与湿实验(物理)必须构成闭环,失败与负结果同样是宝贵证据,不能被丢弃;
  • 可审计:每一个结论都必须能追溯到文献、数据与代码,否则无法获得同行信任。

这正是 Colulu Agents 试图回答的问题。它的思路不是把科研流程做成一个个孤立的对话,而是将科学发现过程系统化为一套写进"灵魂"(soul.md)的通用智能体工作流——从任务分型、文献体系、试验方案设计,到数字模拟、湿实验对接、迭代决策与成果打包,全部纳入一个可长时运行、可反馈迭代、可审计追溯的闭环。

接下来的文章,我们将从四个维度展开:Colulu Agents 如何支撑 AI4S 的长时、反馈与证据治理需求;AI4S 工作流的流程体系;支撑这套流程的 Skill 体系;以及一次真实的案例实践——soul.md 工作流从 v5.0 到 v6.1 的升级。


在这里插入图片描述

第一章:Colulu Agents 如何支撑 AI4S

如果 AI4S 是一场马拉松,那么大多数对话式 AI 工具只能陪你跑完前一百米。科研任务的真实形态是:长时运行、反复反馈、全程留痕。Colulu Agents 的支撑能力,正是围绕这三个关键词构建的。

1.1 长时运行:让 Agent 撑过数天的计算马拉松

科研计算任务动辄运行数小时甚至数天,任何一次崩溃都可能意味着全部重来。Colulu Agents 为此内置了一整套"弹性执行"机制:

  • 检查点(checkpoint-manager):运行中的关键变量被周期性地"物化"保存,即使进程崩溃,也能从最近的检查点恢复,而非从头再来;
  • 监控面板(run-dashboard):任何预估运行超过 5 分钟的任务,强制启动异步监控面板,实时展示计算进度与状态——这条被写进了工作流铁规:不是建议,而是必须;
  • 熔断降级(workflow-monitor):内置同步监控哨兵,检测到 NaN、梯度冲突等异常信号时自动熔断,保存现场并输出崩溃报告,避免带病运行;
  • 断点续跑(notebook-compiler):结果自动归集回可一键重跑的完整 Notebook,配合自适应降采样、软超时与指数退避重试,让 Agent 在资源波动中"活着"完成任务。
    在这里插入图片描述
    图 1:Colulu AI4S 支撑能力总览——四类能力如何覆盖科研全链条

一句话小结:长时运行不是"等得起",而是"扛得住、断得起、续得上"。

1.2 反馈闭环:干实验与湿实验互相校验

纯数字工作流(文献→数据→代码→报告)只是 AI4S 的一半。真正的科研闭环要求数字预测与物理实验互相校验——这正是 Colulu Agents 把"湿实验"作为一等公民的原因:

  • 干-湿闭环:工作流在数字模拟与湿实验之间建立显式连接。湿实验阶段负责把数字假设翻译为可执行的实验指令(实验协议、仪器脚本),并接收实验返回的数据;
  • 失败即证据:所有湿实验结果——包括失败与负结果——全部入库,作为后续迭代的依据;失败分析按根因分类,输出恢复建议;
  • 干湿逐点比对:实验结果与数字预测逐点比对,偏差超过阈值自动触发根因分析(是数据问题?模型问题?还是实验操作问题?);
  • 迭代决策:每轮循环的停止/继续决策由迭代控制器基于"数值指标 + 证据差距"双驱动做出,而非主观感受;假设信念的更新被显式记录,并附加元反思,识别模式与认知盲区。

一句话小结:反馈闭环让每一次失败都成为下一次设计的输入,而不是被丢弃的噪音。

1.3 证据治理:让每个结论都有"出生证明"

AI4S 最大的信任危机来自"编造"——模型自信地输出一个看似合理的结论,却没有任何来源。Colulu Agents 将系统的数据真实性规则升级为贯穿全链的"证据真实性"铁规:

  • 来源与置信度:一切产出(试验方案、模拟结果、综述、结论)必须标注来源(用户文件/文献/数据/实验记录)与置信度;找不到可靠材料时,必须明确声明"未找到数据/证据",严禁编造;
  • 主张-证据审计:核心论断必须绑定具体证据(文献+页码、数据+行号、结果+图号),缺失证据的论断在审计报告中被标记为"弱证据";
  • 研究账本:每张图、每个结论都有一份"出生证明"——记录生成代码、运行环境、输入数据版本、参数设置与决策依据,全流程逐阶段登记;
  • 批判性检查点:在假设生成后、实验设计后、结果解读后、结论形成前四个关键决策点,强制回答批判性问题(可证伪吗?对照组充分吗?效应量有意义吗?存在确认偏误吗?)。

一句话小结:可审计不是事后补文档,而是每一阶段强制留下的决策痕迹。

1.4 多智能体协同:通才协调,专家执行,独立审核

单个 Agent 很难同时精通文献、统计、建模与实验设计。Colulu Agents 采用三层多智能体架构:

  • 协调层(通才 Agent):理解研究意图、任务分型、拆解子任务、调度 Skill 与子 Agent,维护研究账本;
  • 执行层(专家子 Agent):按需派生文献专家、数据专家、建模专家、实验设计专家等并行会话,各自调用领域 Skill 专注执行;
  • 审核层(独立审核 Agent):对关键产物做交叉验证——逻辑一致性、证据充分性、可复现性,签发"审核闸门"。

研究问题陈述、试验方案、干湿比对结论与最终报告,都必须通过审核层的检查才能进入下一阶段——让"评审"成为流程的一部分,而不是事后环节

一句话小结:多智能体的价值不是"多个模型聊天",而是把科研中的分工与评审制度化。

第二章:AI4S 工作流:流程体系

第一章回答了"Colulu Agents 凭什么支撑 AI4S";本章回答"AI4S 到底怎么跑"——即把科学发现过程系统化为可执行、可审计、可进化的流程。

2.1 Gate 0:一切任务的第一道门——任务分型

Colulu Agents 不会对"帮我把这段 SQL 跑一下"和"帮我设计一个药物筛选实验"使用同一套流程。任何请求进入工作流,首先经过 Gate 0 任务分型

  • Track-A 传统任务(非科研闭环):数据分析、文档处理、SQL 查询、日常办公——走轻量 5 步:解析 → 资产检查 → 执行 → 证据核对 → 交付归档,去除科研强制项(如 .ipynb 载体、长任务监控、论文级打包);
  • Track-B 科研全链条(科学发现/研究闭环):涉及假说、试验、文献体系、科研产出——走九阶段闭环。

分型之后,Track-B 还要进一步判别研究问题类型,动态路由到不同的子工作流模板:

问题类型 路由策略
复现验证型 严格锁定数据/代码/环境版本,输出一致性报告
数据驱动发现型 强化数据治理与统计验证
假设驱动实验型 嵌入"干-湿实验闭环"
方法开发型 强化代码生成与基准测试,强制与 SOTA 对比
综述构建型 强化文献体系与成果打包,压缩数据/计算阶段

在这里插入图片描述

图 2:Gate 0 双轨流程全景——同一套系统,两套流程,五条路由

一句话小结:同一套系统、两套流程、五条路由——“轻任务轻做、重任务重做”。

2.2 Track-B:科研全链条九阶段闭环

九阶段不是线性流水线,而是一个可进可退的闭环:从问题定义出发,经过文献、设计、数据、模拟、湿实验、验证,在迭代决策处回环,直到证据差距消除,才进入成果打包。

Phase -1 问题定义(RQC 研究问题证书)
   → Phase 0 资产盘点与差距分析(四维资产 + gap 消除)
   → Phase 1 文献体系构建(≥30 篇排序、方法学抽取)
   → Phase 2 试验方案设计(参数溯源 + 对照组文献 + 统计功效 + 虚拟试验预演)
   → Phase 3 数据获取与治理(科学表征标准化)
   → Phase 4 数字模拟/计算实验(.ipynb 载体 + 检查点/监控/熔断)
   → Phase 5 湿实验对接与执行(Safety Gate + 失败五类分析 + 反馈入库)
   → Phase 6 结果分析与验证(统计检验 + 领域规则 + 干湿逐点比对 + 证据审计)
   → Phase 7 迭代决策(数值+证据双驱动 + 信念更新 + 元反思)
   → Phase 8 成果打包与资产沉淀(论文级交付 + 复现包 + 假说库回写)

图 3:Track-B 科研九阶段闭环——从问题定义到资产沉淀的可进退闭环

几个值得展开的设计:

Phase -1:先定义问题,再动手。 用 PICO 等框架把模糊意图结构化,产出研究问题证书(RQC)——包含原始定义、显式假设、机制模型、张力/矛盾点、可证伪假说、最小决定性实验与失败更新规则。"可失败"被显式写入规范:连"什么条件下算失败、失败后如何更新"都要提前定义。

Phase 2:证据最强约束阶段。 每个实验参数必须有文献或预实验来源(parameter_justification.json);对照组设计必须引用 ≥2 篇同领域文献;统计方案基于文献效应量预估;并且在花一分钱做湿实验之前,先用模拟器跑一遍虚拟试验(simulation_before_wetlab.json),预判可行性与预期范围。

Phase 5:湿实验是一等公民。 把数字假设翻译为可对接自动化平台的实验指令(移液工作站脚本、PCR 程序),通过 Safety Gate 安全门检查后执行;所有结果——包括失败与负结果——全部入库,失败按五类根因分析并给出恢复建议。

Phase 6 → 7:验证与迭代构成闭环。 干实验结果与湿实验结果逐点比对,偏差超阈值自动根因分析;核心论断必须绑定证据(claim 审计,弱证据标记);迭代控制器基于"数值指标 + 证据差距"双驱动决定继续/停止/调整,信念更新与元反思被显式记录。

Phase 8:成果打包不是终点,而是资产沉淀的起点。 交付论文级报告(按领域模板)、可复现包,并把假说库、知识空间回写——让本次研究成为下一次研究的资产。

2.3 纪律层:九条铁规 + 批判性检查点 + 审核闸门

流程要真正可信,光有阶段划分不够,还需要"不可违反"的纪律。工作流定义了九条铁规,其中四条最能体现设计哲学:

  • 铁规 7 · 证据真实性(最高优先级):所有输出必须基于可靠材料(用户文件/文献/数据/实验记录),标注来源与置信度;找不到证据时必须声明"未找到",严禁编造——这是 AI4S 信任的底线;
  • 铁规 8 · 批判性检查点:在假设生成后、实验设计后、结果解读后、结论形成前四个决策点强制自问(可证伪吗?对照组充分吗?效应量有意义吗?存在确认偏误吗?);
  • 铁规 3 · 代码必须进 .ipynb:每个代码块标注 # Asset: 资产来源,杜绝"黑盒脚本";
  • 铁规 6 · 归档三件套:资产清单 + 主张-证据审计 + 研究账本,缺一不可。

此外,关键产物(研究问题、试验方案、干湿比对结论、最终报告)必须通过审核闸门——由独立审核层交叉验证后,才能进入下一阶段。

2.4 SCI 级输出规范:把"合格"变成可检查的契约

科研产出是"门面",Colulu Agents 不依赖模型临场发挥,而是把 SCI 要求参数化为契约:图形必须 PNG+SVG 双格式、300dpi、色盲安全配色、字号 ≥7pt;报告按领域模板(nature/acs/biomed/ai_ml)生成骨架,摘要 ≤200 词、三线表、编号引用;每张图必须绑定"出生证明三件套"(数据来源 + 生成代码 + 证据条目),孤儿图一律拦截。

一句话小结:流程决定"做什么",铁规决定"不做什么",输出规范决定"做成什么样"。

第三章:Skill 体系——AI4S 的"技能/工具库"

流程定义了"做什么",但真正让 Agent "会做科研"的,是一整套按阶段构建的 Skill 体系。本章讲清楚三件事:构建了哪些 Skill、整体是怎么通盘考虑的、以及这套体系如何自我生长

3.1 构建思路:从"手写代码"到"Skill 优先"

一个朴素的问题:为什么不让 Agent 直接写代码、画图、跑流程,而要额外构建几十个 Skill?

因为科研要求可复用、可审计、质量稳定——而临场手写恰恰做不到这三点:每次生成的代码风格不一、无法沉淀为团队资产、质量依赖模型发挥。v6.1 工作流因此确立了 Skill 优先纪律:Agent 在每个阶段不得直接用底层工具手写实现,而必须先 load_skill 加载对应 Skill,再按 Skill 文档执行。

这背后是一套四级调用策略(P0–P3)

  • P0 资产检查list_skills() / search_skills() / search_space() 先行——先看有什么,避免重复造轮子;
  • P1 Skill 执行load_skill("<slug>") 按文档执行——标准路径;
  • P2 动态构建:缺失时用 skill-creator 现场创建并注册;
  • P3 底层工具:仅当 Skill 文档明确指示时,才直接使用 write/bash。

通盘考虑的一句话总结:流程驱动、分层建设、契约下沉、自举生长、领域可插拔

3.2 一张大表看全:为 AI4S 构建的 Skill 全景

以下是 v6.1 工作流与 Skill 体系的完整映射。表格同时回答两个问题:构建了哪些(Skill 列)与如何通盘考虑("定位/职责"与"状态"列——先建核心,按需补齐细节):

流程阶段 构建的 Skill 定位 / 职责 状态
贯穿全局 web-search / knowledge-rag / markdown-wizard / code-reviewer / file-converter 通用基础能力(检索/知识/写作/审查/转换) 已注册
Gate 0 分型 task-profiler 任务分型路由(Track-A/B + 五类研究问题判别) 按需构建
Phase -1 问题定义 claim-auditor 研究问题证书(RQC)审核闸门、证据审计 按需构建
Phase 0 资产盘点 data-viz / gap-analyzer / skill-creator / data-adapter-generator / task-creator / knowledge-rag 四维资产盘点、差距分析、缺失能力动态构建 已注册
Phase 1 文献体系 web-search / paper-ranker / pdf-batch-downloader / pdf-analyzer / knowledge-rag / markdown-wizard / sci-plotting 检索 → 排序 → 批量下载 → 解析 → 综述 核心已注册
Phase 2 试验设计 experiment-designer / simulation-runner / claim-auditor 干/湿试验方案、参数来源追溯、虚拟试验预演 按需构建
Phase 3 数据治理 domain-data-custodian / data-viz / sci-plotting 领域清洗、科学表征标准化、数据报告 已注册
Phase 4 计算实验 ipynb-initializer / task-creator / checkpoint-manager / run-dashboard / notebook-compiler / workflow-monitor Notebook 骨架、断点续跑、监控面板、熔断、结果归集 已注册
Phase 5 湿实验 wetlab-feedback / experiment-designer 湿实验指令、Safety Gate、失败五类分析、干湿比对 按需构建
Phase 6 验证审计 validation-rule-engine / ood-test-runner / simulator-bridge / claim-auditor 领域验证规则、OOD 测试、模拟器对比、claim-证据绑定 已注册 + 按需
Phase 7 迭代 iteration-controller / hypothesis-manager 数值+证据双驱动决策、假说信念更新 已注册 + 按需
Phase 8 打包质检 infographic-designer / markdown-wizard / notebook-verifier / sci-report / output-inspector SCI 信息图、论文级报告、可复现验证、输出质量门 核心已注册

在这里插入图片描述

图 5:Colulu Agents 产品中的【Skill & Tools】界面——已注册 Skill 与工具的集中管理视图

统计:表格共覆盖 30+ 个 Skill,其中约 20 个为已注册核心技能,10 个为"按需构建"提案(带 * 标记)——先建核心、按需补齐,避免过度建设。

在这里插入图片描述

图 6:科研 Skill 生态图谱——按流程阶段组织的 Skill 能力域拓扑

3.3 自举:Skill 生态的自我生长

这套体系最特别的一点是能自己长出新 Skill。当 Phase 0 差距分析发现某个环节没有对应技能时,Agent 不依赖人工补丁,而是:

  1. load_skill("skill-creator") 读取构建规范;
  2. 编写新 SKILL.md 并注册到技能库;
  3. 新资产必须附带存活期标签(如 expires_afterscope),过期自动回收,避免技能库膨胀。

先检索、后构建是铁律——绝不在已有能力时重复造轮子。

在这里插入图片描述

图 7:Skill 自举与五类扩展接口——缺什么造什么,且按领域可插拔

3.4 五类扩展接口与领域适配:一套流程,四大学科

领域特异性通过五类扩展接口注入:专用技能、数据适配器、工作流模板、校验规则库、领域本体/输出模板——均遵循"先检索、后构建"原则。

核心流程不随领域改变;变化的是"四件套":本体/术语(医药 CTCAE、化学 SMILES、生物 GO、AI 基准集)、工具/Skill 示例、验证规则库(PK/PD 边界、反应动力学、生理约束、数据泄露检测)、输出规范模板(biomed/acs/nature/ai_ml)。同一个九阶段流程,医药、化学、生物、AI 四大学科各取所需

一句话小结:Skill 体系的价值,在于把"会做科研"从模型的天赋,变成了系统可复用、可审计、可生长的资产。

第四章:案例研究

4.1 生态环境学科学研究案例:螺旋藻多因子耦合胁迫机制分析

4.1.1 案例概览

维度 内容
科学问题 高强度光照 + 高温如何驱动 pH 升高与溶解氧过饱和,进而对螺旋藻(Spirulina platensis)形成协同胁迫(光抑制/氧抑制)?
任务轨道 Track-B 科研/干实验(真实现测数据,无湿实验)
数据源 数据空间"藻类数据文档":NASA 跑道池实验数据 algae_data.mat(12.8 MB)+ Readme.pdf
核心方法 条件 Granger 时滞因果网络 + SEM 路径分析 + 分段回归/临界阈值识别
核心结论 光照对生长的抑制以间接路径为主(占 73%);DO 断点 376 μmol/L、pH 断点 9.85
交付物 6 张论文级图 + 7 页 SCI PDF 报告 + 监控面板 + 研究账本 + 主张-证据审计

在这里插入图片描述

4.1.2 第一环 · 计划:先想清楚,再动手(Gate 0 → plan.md)

以"藻类生物过程工程专家"身份发起任务,要求围绕"光照-温度-pH-溶解氧(DO)多因子耦合胁迫机制"展开分析,并明确三项要求:构建多变量时滞因果网络(Granger)、用结构方程模型量化路径系数(SEM)、识别临界条件(阈值)。

系统没有立刻开始跑代码——这正是 v6.1 工作流与普通"问答式 AI"的分水岭。它先完成三件事:

  1. 任务分型(Gate 0):识别出这是涉及假说、因果推断与科研产出的 Track-B 任务,生成 research_question_profile.json,锁定"数据驱动发现型 + 假设驱动实验型"的混合路由;
  2. 问题定义(Phase -1):把用户的模糊意图结构化为三条可检验的因果链——(a) 光照→pH(光合耗 CO₂ 致碱化);(b) 光照/温度→DO(光合放氧);© DO/pH→生长速率 μ(高氧高碱胁迫);
  3. 资产盘点(Phase 0)search_skills 在 52 个已注册 Skill 中匹配到 publication-style(SCI 输出契约)、academic-searcher(文献检索)等,并核实数据空间真实文件结构——.mat 含 3 个跑道池、约 7.6 万点 5 分钟高频辐照度与 7.7 万点水温、以及低频的 pH/溶解氧/OD 观测。

随后系统提交研究计划 plan.md(含数据接入、三大任务、可视化交付与"诚实约束"六条),经用户确认后才进入执行——这是全流程第一个 HITL 检查点。
在这里插入图片描述

图 8:第一环 · 计划——产品中的研究计划界面:任务分型、九阶段计划与用户确认

4.1.3 第二环 · 论文研究:站在最新研究的肩膀上(Phase 1.1)

计划确认后,系统没有凭经验拍脑袋定方法,而是先做文献方法学研究——这呼应了第二章 Phase 1 的"文献体系构建",也是 AI4S 与普通数据分析最本质的区别:

  • academic-searcher 聚合 arXiv / Crossref / Semantic Scholar 检索真实文献元数据,产出 literature/method_review.md(141 条真实记录);
  • 从检索结果中提取方法学创新点,其中最关键的一条:PCMCI(Runge et al., 2019, Science Advances)的"共因控制"思想——为后续的条件 Granger 方法创新提供了依据;
  • 遇到 arXiv / Semantic Scholar API 限流(HTTP 429)时,系统如实记录未获取的文献,绝不虚构

在这里插入图片描述

图 9:第二环 · 论文研究——文献检索、方法学评审与创新点提取界面

4.1.4 第三环 · 方法设计:把科学问题翻译成可执行方案(Phase 2)

论文研究产出方法依据后,系统把"三个任务"细化为可执行的方法设计,并做出四项关键决策:

任务 方法设计 关键决策
时滞因果网络 逐池 Granger 因果检验(滞后期 3–5 天,AIC/BIC 选阶) 条件 Granger:先对温度/pH 残差化再检验,借鉴 PCMCI 共因控制
路径量化 semopy 显变量路径模型(外因:光/温 → 中介:pH/DO → 内因:μ) 显变量 SEM(规避潜变量求解器限制);引入 PAM0 作混淆协变量
阈值识别 分段回归(BIC 选段)+ 样条验证 + 三维响应曲面 拐点可操作化:DO 红线、pH 警戒线
数据预处理 5-min→日重采样、低频插值、DO 饱和计算 APHA/Mortimer 公式(弃用产生"天文数字"的 Weiss 公式)

在这里插入图片描述

图 10:第三环 · 方法设计——研究方法的整体框架图:数据接入 → 因果网络 → 路径量化 → 阈值识别

4.1.5 第四环 · 执行:与真实数据"斤斤计较"(Phase 1a–4)

方法既定,进入真刀真枪的执行。这一环考验的是工程韧性与统计严谨性:

  • 日面板构建:高频辐照度/水温重采样为日尺度(日均、日最大、光累积量),低频 pH/DO/OD 线性插值补齐(gap 上限 8 天,超出置 NaN 并诚实标注);通过 OD 曲线识别 day 20–130 稳定生长期;产出 780×25 的 panel_daily.csv——稳定期 DO 饱和度长期处于 223–236%(2–3 倍过饱和)
  • 任务一 · Granger:光照→DO 因果显著(滞后 2 天,p<0.01,3/3 池一致);而条件化后显著性下降(p→0.089),揭示部分"光→氧"链源于与温度/pH 的共变——这不是失败,而是方法价值的体现:系统看清了因果结构的全貌;
  • 任务二 · SEM(n=378):
路径 标准化系数 解读
pH → μ −0.52 (p<0.001) 高碱胁迫是生长抑制的核心中介
光照 → μ 直接 −0.09(不显著) 直接光抑制证据弱
光照 → μ 间接(经 pH/DO) −0.25 主要胁迫路径
光照 → μ 总效应 −0.34 间接占 73%
  • 任务三 · 阈值:分段回归 + 样条验证得到两个可操作拐点——DO 超过 376 μmol/L(约 270% 饱和度)后生长速率转降;pH 超过 9.85 后抑制斜率从 −0.068 恶化到 −0.176(抑制增强 2.6 倍)

呼应第二章:这"三个数值"就是这项研究交付给工程世界的答案——跑道池的 DO 控制红线与 pH 警戒线。

4.1.6 第五环 · 结果交付:从图表到论文(Phase 5–8)

执行完毕,系统进入"门面工程"阶段——每一张图都经过 publication-style 契约与质量门检查(呼应第三章的 Skill 体系):

  • 6 张论文级图:多因子日面板全景、Granger 因果 DAG、SEM 路径系数图、阈值响应曲线、三维响应曲面、方法框架图——全部遵循 Okabe-Ito 色盲安全配色、≥7pt 字号、300dpi PNG + SVG 双格式;
  • SCI PDF 报告(7 页,1.27 MB)+ 一页式结果信息图 + 实时研究监控面板research_dashboard.html);
  • 双账本归档research_ledger.md(逐阶段输入/方法/产出/决策)+ claim_evidence_audit.md(6 条核心结论 C1–C6 逐一绑定证据与置信度,如"DO 断点 376 μmol/L"标注为中置信度并注明分段线性假设的局限)——呼应第二章的"出生证明三件套"。

在这里插入图片描述

图 11:第五环 · 结果交付——一页式结果信息图:从 6 张论文级图到可传播的科研信息图

在这里插入图片描述

图 12:第五环 · 结果交付——7 页 SCI 级 PDF 报告:按领域模板生成的论文式交付

4.1.7 五环启示:AI4S 能力的一次完整兑现

回看这条"计划 → 论文研究 → 方法设计 → 执行 → 结果交付"链条,每一环都对应前文的一项设计:

  1. 计划与论文研究——Gate 0 任务分型、Phase -1 问题定义、Phase 1 文献体系:先想清楚、先看文献,再动手(呼应第二章 2.1–2.2);
  2. 方法设计——从最新研究(PCMCI)中汲取方法创新,而不是重复教科书的套路(呼应第二章"方法学抽取");
  3. 执行——长时运行(十余个脚本、数十次工具调用,中途会话恢复仍能接续)、反馈闭环(条件 Granger 的"显著性回落"成为新认识,负结果同样是产出)(呼应第一章 1.1–1.2);
  4. 结果交付——Skill 体系即生产力(publication-style / academic-searcher / paper-info-extractor 按需加载)、证据治理落地(每个数值可定位到数据文件与分析脚本,连"Weiss 公式不可用"都写进账本)(呼应第三章、第一章 1.3);
  5. 诚实的局限——研究账本明确记录插值自相关膨胀、三池共享环境光温、文献 API 限流未虚构:一个会承认自己局限的系统,才配得上科研协作伙伴的位置

4.2 生命科学(单细胞组学)案例:人类胚胎骨骼发育的新颖转录因子发现

另一种同样重要的能力——当数据缺席时,系统如何守住"证据真实性"的底线,再在数据到位后把完整流水线跑通

4.2.1 案例概览

维度 内容
科学问题 在人类胚胎骨骼谱系分化过程中,自主发现此前未被充分报道的关键转录因子(TF)
任务轨道 Track-B 科研/干实验(数据驱动发现型)+ BIOMNI 生物科研编排 Skill
输入数据 用户描述:约 33.6 万细胞核,snRNA-seq + snATAC-seq(但数据路径为占位符,实际未提供
替代真实数据 Human embryonic limb cell atlas(Zhang et al., Nature 2023, DOI 10.1038/s41586-023-06806-x),102,324 细胞
核心结论 发现 NKX3-2、OSR2、FOXC1、OSR1 等高活性、低文献密度的候选新 TF;已知主控因子(RUNX2/SOX9/SP7)作为方法学阳性对照验证准确
交付物 候选 TF 优先级表 + UMAP/轨迹/网络/活性全套图 + 中英文双版报告 + 证据审计(C1–C8)

4.2.2 第一环 · 计划:把"找新因子"变成可证伪的假设(Gate 0 → plan.md)

以 BIOMNI 生物科研编排 Skill + AI4S 发起任务。系统先做问题结构化——用 PICO 框架定义人群(骨骼谱系细胞)、干预(TF 调控活性变化)、对照(不同发育阶段与细胞类型)、结局(高活性但低文献密度的候选 TF),并显式写下可证伪假设 H1失败条件

H1:存在一批 TF,其调控网络活性在成骨/软骨谱系分化轨迹上显著上调,且染色质可及性支持直接调控;其中若干在 PubMed/综述文献中研究密度显著偏低。
失败条件:若所有高活性 TF 均为 SOX9/RUNX2/SP7 等已知因子,或活性上调无染色质证据,则 H1 不成立。

随后规划 7 步分析流程(预处理整合 → 图谱构建 → 轨迹推断 → 调控网络 → TF 活性评估 → 新因子筛选 → 成果打包),并把每个参数(质控阈值、n_pcs、分辨率、批次校正算法)都登记来源——参数不再"拍脑袋"。

在这里插入图片描述

图 13:第一环 · 计划——PICO 结构化研究问题、可证伪假设与 7 步分析流程

4.2.3 第二环 · 论文研究 + 第三环 · 方法设计:生物领域编排的专业性(Phase 1–2)

本案例的方法层由生物专用 Skill 体系支撑,展示了第三章"领域适配四件套"在真实任务中的形态:

  • biomni-orchestrator(生物科研编排 Meta-Skill):覆盖"选题立项→文献调研→实验设计→数据获取→分析统计→结果解读→论文撰写"七阶段流程,作为领域调度中枢路由本次任务;
  • b-repl-bio(科学计算 REPL):提供持久化的 Python 计算环境,自动捕获 PNG+SVG 双格式图(≥300dpi);
  • 方法设计:批次校正用 Harmony 计划、Windows 构建失败后等价替代为 scVI(诚实记录,而非隐瞒);TF 活性评估采用 chromVAR/SCENIC 代理法并明确标注其局限;新因子判据定义为 novelty = 谱系活性delta × 文献稀有度

在这里插入图片描述

图 14:第三环 · 方法设计——研究框架图:数据接入 → 质控整合 → 图谱/轨迹 → 调控网络 → TF 活性 → 新因子筛选

4.2.4 关键转折 · 数据阻塞:宁可交付空管道,绝不编造数据(Phase 0)

这是本案例最值得写进博客的一幕。任务发起时,数据路径字段是占位符 [请在此处提供你的数据存储路径]——从未被填写。系统没有"假装有数据",而是做了一次教科书式的真实性调查:

调查项 结果
本地全盘搜索(.h5ad/.h5/.mtx/.rds 等) ❌ 未找到任何数据文件
已连接数据空间 / 知识空间 ❌ 无单细胞数据集
CELLxGENE Discover(387 个 collection) ❌ 无"人胚胎骨骼发育多组学(33.6 万核 snRNA+snATAC)"精确匹配
PubMed/Crossref 检索 ⚠️ 仅找到同类近邻研究,无法唯一确定可下载的精确匹配集

结论写入了 STATUS_DATA_BLOCKER.md,并掷地有声地声明:“我绝不能伪造 33.6 万个细胞核的 snRNA+snATAC 数据,再据此绘制 UMAP、伪时间轨迹、TF 活性热图并冒充’真实分析结果’——那等同于数据造假。” 同时给出三条路径:A 提供本地数据(最快)、B 提供公开数据集标识符、C 交付"空管道 + 可复现模板包"(严格标注为脚手架,不冒充结果)。

呼应第二章铁规 7(证据真实性):找不到数据,就明确说"未找到"——这是 AI4S 信任的底线,也是本案例与 4.1 同样重要的能力展示。

4.2.5 第四环 · 执行:挂载真实公开数据,把流水线真正跑通(Phase 1a–4)

用户授权继续执行后,系统选择路径 B 的变体——检索并挂载了真实公开数据:Human embryonic limb cell atlas(Zhang et al., Nature 2023),并如实标注:该数据为 102,324 细胞,与用户描述的 33.6 万核规模不一致(这一差异作为局限 D3 记录,绝不默认两者等价)。随后完整跑通全部任务:

  • 质控与整合:102,324 细胞、25,769 基因(Ensembl→HUGO 映射 21,162 个);
  • 图谱构建:Leiden 28 clusters、34 类细胞注释,其中骨骼谱系细胞 50,966 个(49.8%),并发现远端区含更多软骨/骨化前沿细胞(符合近心端→远心端骨化规律);
  • 轨迹推断Mes(间充质)→ OCP(成软骨成骨祖细胞)→ 软骨细胞系 → OsteoB(成骨细胞) 的连续分化轴;
  • 调控网络:37 个候选 TF 与标志性靶基因的共表达网络(31 条边),RUNX2/SP7/SOX9 与其经典靶基因强共表达,验证方法学准确
  • TF 活性评估:41 个 TF × 14 类细胞。分化后期活性最强的 IHH、DLX5、SP7、MEF2C、RUNX2、SOX9 与已知骨/软骨主控因子完全吻合——这是最有力的"方法学阳性对照"。

在这里插入图片描述

图 15:第四环 · 执行——UMAP 上的骨骼谱系分化轨迹:Mes → OCP → 软骨系 → 成骨

4.2.6 第五环 · 结果交付:候选新 TF 与多版本报告(Phase 5–8)

最终交付物包含核心发现——候选新转录因子优先级表(高活性 × 低文献密度):

优先级 转录因子 谱系活性 PubMed 计数 提示
★1 NKX3-2 +0.59(软骨) 仅 39 人类胚胎骨骼谱系中几乎未研究
★2 OSR2 −0.40(间充质) 仅 30 极低文献
★3 FOXC1 +0.57(软骨) 389 骨骼形态发生候选
★4 OSR1 −0.67(间充质) 157 骨骼前体调控候选
TBX15 / MEIS2 / ZIC2 / FOXC2 40–294 低文献候选

报告在"证据审计"层面保持了同样的严谨:核心论断 C1–C8 逐一绑定证据定位与置信度(如候选 TF 的"新颖性"标注为统计与文献层面证据),并显式列出不升格为结论的局限——D1 无 snATAC 染色质直接证据、D2 无功能干预实验、D3 数据规模与任务描述不一致。交付形式包括中英文双版研究报告、候选 TF 表、全套图表与复现包,全部过出生证明三件套登记。

在这里插入图片描述

图 16:第五环 · 结果交付——研究过程信息图:从数据阻塞到候选新 TF 的完整过程

第五章:结语与展望——把"做科研"做成可复现的流程

5.1 四个答案:Colulu Agents 如何支撑 AI4S

问题 答案 案例佐证
凭什么能撑起长时科研? 检查点、监控面板、熔断降级、断点续跑——长时运行不是"等得起",而是"扛得住、断得起、续得上" 螺旋藻案例十余个脚本、数十次工具调用的长链执行
凭什么能形成科研闭环? 干-湿实验互相校验、失败即证据、数值+证据双驱动迭代——每一次失败都是下一次设计的输入 条件 Granger 的"显著性回落"成为新认识
凭什么让结论可信? 证据真实性铁规、主张-证据审计、研究账本、批判性检查点——每个结论都有"出生证明" 两案例的 claim-evidence 审计与诚实局限声明
凭什么适配不同学科? Skill 优先、自举生长、领域四件套注入——同一套流程,医药/化学/生物/AI 各取所需 胚胎骨骼案例的 biomni 生物编排 Skill

5.2 两个案例的双重验证

两个真实案例,恰好构成了一次完整的"能力-底线"验证:

  • 数据在位(螺旋藻):12.8 MB 真实数据 → 7 页 SCI 论文,DO 断点 376 μmol/L、pH 断点 9.85,全部数值可溯源到数据文件与脚本;
  • 数据缺席(胚胎骨骼):系统拒绝编造 33.6 万个细胞核,先交付"诚实报告 + 空管道",再在真实公开数据(Nature 2023,102,324 细胞)到位后把全流程跑通,发现 NKX3-2、OSR2 等高活性低文献候选 TF。

两种情境,同一条底线:证据真实性。这正是 Colulu Agents 与其他"看起来很像"的 AI 工具之间最本质的差别——它不会为了让你满意而制造一个没有来源的结论。

5.3 展望:AI4S 的下一个台阶

以 AI4S 工作流为基线,值得期待的方向至少有三个:

  1. 更深的多智能体协作:协调-执行-审核三层架构已经验证可行,下一步是让专家子 Agent 在更长的时间尺度上并行推进多个子课题,审核层以更细粒度的"证据 DAG"交叉验证;
  2. 更强的领域纵深:从"四件套注入"走向"领域原生 Skill 生态"——正如生物领域的 biomni 编排,每个学科都能长出自己的一整套方法论 Skill,并随项目使用持续进化;
  3. 更完整的干-湿闭环:当湿实验自动化平台(移液工作站、测序仪)与工作流的 Safety Gate 直接对接,"数字假设 → 物理验证 → 数据回灌"的闭环将从论文描述变为日常操作;
  4. 更聪明的自我进化:评估体系(Evaluation)反哺工作流本身——每一次跑通的项目都在沉淀新的 Skill、新的规则库、新的假说库,让系统越用越懂科研。

结束语

回到引言的问题:AI4S 需要什么样的 Agent?

它需要能跑完马拉松(长时运行),能在失败中学习(反馈闭环),能为每个结论负责(证据治理),能学会任何新领域(Skill 体系)。更重要的是,它必须在"没有数据"时敢于说"没有"——因为科研的信任,从来不是靠模型自信堆出来的。

Colulu Agents 用一套写进灵魂(soul.md)的工作流回答了这个问题:Workflow 是科学方法流程,Todo 是每一步的自检清单与任务分解——它想成为的不是更会写代码的助手,而是把"做科研"这件事本身,做成一个可复现、可审计、可进化的流程。

当一个 AI 系统把"诚实"写进最高优先级铁规,把"可证伪"写进研究计划,把"出生证明"绑到每一张图上——它就不再是科研的旁观者,而是科研共同体的一员。

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐