从一张研究协议到一条可信证据链:RareLink 的 DGX Spark 黑客松十日谈

作者:丁毓,黄宇豪,陈禹墨 寻找新的大陆团队

本文为 DGX Spark Hackathon 参赛成果记录。RareLink(稀联)是面向罕见病及小样本多中心医学影像科研的工程原型:它不提供诊断或治疗建议,也不将单机逻辑站点包装为真实医院部署。

关键词: DGX Spark、NVIDIA FLARE、MONAI、联邦学习、医学影像、Agent、差分隐私、罕见病科研

写在前面:我们想解决的不是“再训练一个模型”

参加本次 DGX Spark 黑客松赛事,我们最初的构想十分宏大:让每一台 DGX Spark 设备成为医院科室专属的联邦学习终端,落地罕见病多中心协同科研。但落地开发后我们迅速发现,罕见病医学影像科研的核心痛点,从来不是“训练一个高精度模型”。

罕见病病种繁杂、三维 MRI 训练算力开销大、多中心原始数据无法集中汇总、小样本数据分布不均,且单纯的模型精度分数,无法支撑科研可解释、可复核、可持续迭代的核心需求。

基于真实场景约束,我们收敛了项目目标,正式打造RareLink(稀联) 工程原型:在医疗原始数据不离开科室本地的前提下,将研究协议、站点可行性核验、实验合同、本地模型训练、跨站点参数聚合、隐私安全复核、Agent 智能解读与全流程审计,串联成完整可信的科研证据链

本次十日开发,我们未做浮夸的生产级包装,交付了一套可在真实 NVIDIA DGX Spark 设备上稳定运行、可展示实验缺陷、支持一键证据核验、明确标注能力边界的标准化科研工程原型。

项目开源地址:github.com/dingyucanada/RareLink

Day 1:收敛问题边界,打造可验证的科研成果

“覆盖全品类罕见病”具备传播价值,但无落地验证标准,无法形成可信科研成果。为此,我们锁定儿童高级别胶质瘤多中心 MRI 分割作为核心应用场景,该场景精准契合罕见病科研四大核心痛点:单中心样本量稀缺、四模态三维 MRI 算力消耗高、多站点数据分布不均、原始影像与患者数据严禁跨院集中。

我们确立核心技术分工与边界原则,从源头规避技术越界与场景错位:

不让大模型直接读取、解析医疗 MRI 影像,严格拆分算力与业务链路:由 NVIDIA DGX Spark 承载科室本地 CUDA 加速与三维影像模型训练;MONAI 负责 NIfTI 影像预处理、分割模型推理与医学指标评估;NVIDIA FLARE 统筹多站点联邦学习任务调度与参数聚合;Step 3.7 仅处理脱敏研究协议、锁定实验合同与聚合统计指标。AI Agent 仅作为科研协作工具,辅助梳理流程、沉淀证据,绝不替代医生诊疗与科研决策。

Day 2:以边界为核心,搭建可控科研工作流

医疗科研系统的核心是约束可控、全程可追溯,因此我们将所有核心业务约束写入系统状态机,而非仅作为文档说明,从代码层面固化安全与科研规范:

  • 赛事版本三站点为单台 DGX Spark 模拟的逻辑站点,不等同于真实三甲医院多院区生产部署;
  • 原始影像、标注标签、患者隐私字段、DICOM UID、设备密钥、站点明细数据,全程留存在科室本地,禁止外发;
  • 实验设计 Agent 仅可生成科研方案与合同草案,无法自主锁定生效,必须由研究负责人人工审批确认;
  • 隐私评审 Agent 拥有报告生成阻断权限,但无权放宽数据外发、隐私脱敏的硬性策略;
  • 系统仅用于科研辅助,不输出任何诊疗建议,不做临床有效性、临床落地能力的相关声明。

RareLink 控制面基于 FastAPI + Pydantic + SQLModel 搭建,为科研协议、可行性核验、实验合同、模型训练、结果复核、报告生成配置独立合法的状态流转逻辑。所有 Agent 输出结果均经过结构化校验后,录入审计账本存档,让最终交付成果不再是单一模型分数,而是一套包含审批记录、策略规则、运行日志、模型路径、聚合指标的完整可追溯科研档案。

Day 3:精细化 Agent 分工,杜绝模型单点依赖

为解决通用大模型越权、输出不可追溯、科研流程混乱的问题,我们拆解出五角色专属 Agent 团队,各司其职、相互约束,形成闭环协作机制:

  • 研究主任 Agent:将自然语言科研需求转化为标准化结构化研究协议;
  • 实验设计 Agent:生成多组对照实验方案、训练策略与站点分配规则;
  • 统计评审 Agent:兼顾全局平均指标与最弱站点指标,客观呈现多站点训练差异与风险;
  • 隐私评审 Agent:全程校验数据输出边界、脱敏合规性,阻断违规报告生成;
  • 科研写作 Agent:仅基于系统核验通过的真实实验证据,生成标准化科研报告。

同时我们设置严格的模型降级机制:Step 3.7 仅接收脱敏文本与聚合指标,不触碰原始医疗数据;当网络异常、API 不可用时,系统自动回退为确定性模板 Agent,保障科研工作流持续运行,避免依赖远程大模型导致流程中断。在科研基建场景中,Agent 是可替换、可审计的协作组件,而非不可控的核心单点。

Day 4:基于合成影像跑通全链路,坚守工程真实性

在接入公开医疗数据集前,我们率先构建三逻辑站点四模态 NIfTI 合成影像数据集,完整跑通全技术链路:影像预处理、MONAI 三维 SegResNet 模型训练、Dice/HD95 医学指标计算、模型权重持久化、哈希校验全流程落地。

初期极小样本单轮训练的模型精度表现较差,但我们选择完整保留低分结果与实验日志。低精度指标无法证明临床模型性能,但可以验证影像读取、GPU 正反传播、指标计算、模型存储全链路真实有效,绝非前端虚构数据。这也成为项目核心底线:工程流程跑通,不代表临床效果有效,所有能力边界公开透明。

Day 5:优化联邦评估逻辑,拒绝单一平均分误导

接入 NVIDIA FLARE 联邦学习框架后,三逻辑站点可完成本地模型训练、参数上传、全局参数聚合全流程,支持 Local、FedAvg、FedProx 多种训练策略灵活切换。初期我们沿用行业通用的平均 Dice 指标评估模型,但很快发现核心缺陷:平均指标会掩盖弱势站点的训练退化风险,造成“整体效果优秀”的虚假结论。

为此我们重构评估体系,系统强制展示平均 Dice、最弱站点 Dice、站点指标标准差、HD95 四项核心数据。在多中心罕见病科研中,弱势站点的训练表现、站点间性能差异,是评估实验可行性、判断研究价值的核心依据,远比单一平均分更具科研意义。这一优化让项目从简单的模型训练 Demo,升级为具备科研治理能力的可信实验平台。

Day 6:深挖 DGX Spark 算力价值,适配原生硬件架构

我们将项目完整迁移至真实 NVIDIA DGX Spark GB10 设备,适配 ARM64 架构、CUDA 13、PyTorch 2.10.0+cu130、MONAI 1.6.0、NVIDIA FLARE 2.7.2 全套软硬件栈。实现 CUDA 矩阵计算、三维医学影像训练、联邦任务调度、后端 API、Web 控制台、Agent 工作流在本地算力节点一体化运行。

落地过程中,我们攻克了多项硬件适配工程难题:Docker 代理异常、普通账号 Socket 权限受限、GB10 算力架构兼容告警、统一内存资源压力过载等。我们不修改共享节点基础配置、不通过 SSH 传输大体积影像与模型文件,而是通过复用官方 CUDA 容器、精细化权限管控、单设备多任务串行执行、完整记录兼容告警与资源约束的方式,保障工程稳定性与规范性。

DGX Spark 在本项目中的核心价值,并非简单提供算力,而是实现数据属地训练、算力本地调度、全流程闭环可控,彻底摒弃集中式数据传输的传统模式,贴合医疗数据隐私合规要求。

Day 7:多策略多种子对照,构建稳健实验证据

单次实验结果极易受随机种子、训练策略影响,不具备科研说服力。为此我们设计5组随机种子 × 5种训练策略 × 3轮联邦迭代的对照实验方案,覆盖 Local 本地训练、FedAvg 联邦平均、FedProx 联邦近端、严格 SVT 参数过滤、DP-SGD 差分隐私训练五种核心模式,实现 25/25 实验组完整跑完,无遗漏、无跳过。

为保证对照公平性,本地训练模式自动匹配与联邦训练同等的训练轮次与迭代次数。实验结果客观呈现优劣差异:FedAvg 综合稳定性最优,FedProx 可优化弱势站点性能但平均精度无优势,严格 SVT 参数过滤策略在多次实验中完全失效。我们完整保留所有失败实验组与原始数据,不刻意筛选最优结果,真实还原隐私保护与模型效用的取舍关系

Day 8:落地差分隐私,细化隐私合规边界

联邦学习仅能规避原始数据集中风险,无法杜绝模型参数、聚合指标、运行日志的信息泄露风险。为补齐隐私安全短板,我们基于 Opacus 实现样本级 DP-SGD 差分隐私保护,通过逐样本梯度裁剪、高斯噪声注入、Poisson 采样与 RDP 跨轮隐私会计,量化管控隐私风险。

在 noise_multiplier=1.2、max_grad_norm=1.0、delta=1e-5 的三轮训练配置下,最终隐私会计结果稳定可控:ε = 6.076881,δ = 1e-5

同时我们解决了多项工程细节问题:针对 Poisson 采样空批次导致三维卷积训练报错、空批次隐私预算失真、MONAI 字典样本 dtype 异常等问题完成专项修复。

我们对隐私能力保持严谨表述:当前差分隐私仅覆盖本地模型训练环节,并非端到端、用户级、医院级的全域隐私保障,不构成临床隐私合规认证。

Day 9:构建双向安全校验,兼顾正向通过与反向拦截

为验证跨站点通信安全性,我们搭建跨设备加密通信链路:DGX Spark 部署 FLARE 服务端,Mac 设备模拟第三方站点,完成 mTLS 证书注册、断线重连全流程演练,通信链路稳定可靠。同时设计反向安全测试:使用非法设备凭据发起连接请求,系统成功识别异常身份并拒绝接入,验证证书校验机制的有效性。

针对 Agent 安全边界,我们搭建双向网关防护体系:输入网关自动拦截患者标识、DICOM UID、影像路径、密钥、隐私字段等敏感数据;输出网关禁止生成诊疗建议、违规数据请求、夸大临床结论、私自修改实验合同。

最终完成 12 条输入安全用例 + 14 条输出安全用例测试,实现 26/26 用例全通过,完整验证策略网关的管控能力(非完整渗透测试、非通用模型安全认证)。

Day 10:落地证据驾驶舱,实现实验结果可核验、可复现

开发收尾阶段,我们不再新增功能,聚焦证据标准化、结果透明化、流程可复现,打造专属证据驾驶舱与一键复现工具包。

证据驾驶舱严格区分流程沙盘实机核验收据:沙盘用于演示科研协议、合同审批、Agent 协作全流程;实机收据支持哈希校验、三站点指标查看、全局模型核验、实验边界查询,确保所有成果可溯源、可复核。

一键复现包无需下载影像、模型、密钥、证书,默认核验四大核心工程证据:25组多种子对照实验、DP-SGD 隐私会计结果、Spark-Mac 跨设备 mTLS 安全校验、26条 Agent 网关安全用例。本地无运行产物时,仅生成标注明确的脱敏演示快照,绝不伪造实验结果。

同时我们在 DGX Spark 设备上完成MSD Task01_BrainTumour 公开脑肿瘤数据集真实工程验证,校验数据集 MD5、SHA-256 哈希完整性,对24例四模态 MRI 影像做几何校验与非IID 三站点均分(每站8例),完整跑通单站 CUDA 训练、三站点 FedAvg 联邦聚合全流程,实测数据如下:

测试项目

实测结果

实验数据

MSD Task01 公开数据集,24例四模态三维MRI,均分3个逻辑站点(每站8例)

单站CUDA冒烟测试

7例训练/1例验证,1轮epoch;耗时6.7476s;峰值显存5240.349MiB

三站点FedAvg联邦训练

1轮联邦迭代、每站1轮本地训练,3/3站点参数全部聚合并持久化全局模型

端到端总耗时

69.0084s

全局聚合指标

Dice=0.041624,HD95=102.413666

最弱站点指标

Dice=0.012345,站点Dice标准差=0.024265

注:以上数据仅用于工程链路验证,不代表临床模型性能,不用于诊疗效果评估与策略优劣对比。

十日复盘:已完成能力与明确边界

本次黑客松开发周期内,我们未追求噱头式功能堆叠,聚焦可信、可控、可复现、可追溯四大核心目标,完成阶段性成果落地:

✅ 实现医疗影像数据科室本地留存,基于 MONAI 完成真实三维医学模型训练;

✅ 基于 NVIDIA FLARE 完成多站点联邦参数聚合,规避原始数据泄露风险;

✅ 构建五角色受限 Agent 团队,实现科研全流程标准化、可审计;

✅ 落地样本级差分隐私与 mTLS 加密通信,量化隐私安全能力;

✅ 完整保留失败实验、缺陷数据与能力边界,杜绝科研成果美化;

✅ 打造证据驾驶舱与一键复现工具,实现全流程证据核验。

同时我们清晰界定项目当前边界,不夸大能力:

❌ 非医院生产级系统,无临床诊断、治疗辅助能力;

❌ 仅为单设备多逻辑站点工程原型,未完成真实多院跨网部署;

❌ 未对接医院 PACS/FHIR 临床系统,无真实临床验证数据;

❌ 隐私与安全能力为工程验证级别,未通过专业渗透测试与临床合规认证。

未来展望:打造数据不出院的多中心科研操作系统

后续我们将循序渐进推进项目迭代:首先遵循数据使用规范,基于 BraTS-PEDs 儿童脑肿瘤公开数据集完成外部工程验证;其次对接真实合作医院,部署独立 DGX Spark 客户端,搭建真实多院证书化联邦通信与本地审计体系。

RareLink 的长期愿景始终清晰:不替代医生诊疗,只赋能科研可信,构建一套真正适配罕见病小样本、多中心场景,实现数据不出院、过程可审计、证据可回溯、结果可迭代的医疗科研操作系统。

项目与权威参考链接

更多推荐