随着书生大模型开源生态的不断壮大,越来越多的产品和平台纷纷接入书生大模型。科研人员依托书生大模型持续探索创新,取得了丰富的研究成果;社区用户也不断创造出令人耳目一新的项目。“与书生共创”将推出一系列文章,聚焦这些合作与创新案例。欢迎订阅并踊跃投稿,一起分享经验与成果,共同推动大模型技术的应用与发展。

本文来自科研机构合作案例征集,作者齐子时,硕士二年级研究生,华中科技大学人工智能安全实验室胡晓娅教授团队成员,书生大模型实战营优秀学员,主要研究方向为可解释性医疗多模态大模型与协同智能体。个人主页:https://github.com/QiZishi。

华中科技大学人工智能安全实验室隶属于华中科技大学人工智能与自动化学院。实验室长期致力于前沿技术与安全交叉领域的研究,主要研究工作涵盖垂直领域大模型应用、人工智能内生安全、网络空间安全、数据隐私保护以及工业互联网与工业控制系统的信息安全防护体系构建。

基于当前眼科诊疗领域多模态数据异构性强、优质推理型数据稀缺,且传统模型存在“黑箱决策”与专业知识幻觉的核心痛点,华中科技大学人工智能安全实验室团队基于书生大模型生态(InternVL3、Intern-S1),构建了眼科专用多模态推理大模型 OphVLM-R1 及配套智慧诊疗系统“灵瞳”,通过创新的数据集构建方法、两阶段训练架构与 ReAct 智能体系统,实现了眼科智能诊疗从“感知识别”向“认知推理”的跨越,为临床提供了高效、透明且可信的辅助诊疗方案,有效解决了眼科 AI 在数据、模型与应用层面的多重难题。

项目介绍

“灵瞳”眼科智慧诊疗系统是依托自主研发的 OphVLM-R1 多模态推理大模型构建的专业化医疗 AI 平台,专为眼科影像分析与诊断任务量身打造。该项目的核心目标是破解全球眼科优质医疗资源分布不均、基层医疗机构误诊漏诊率居高不下的行业困境,通过 AI 技术赋能临床医生,尤其是基层医疗工作者,提升眼科疾病的早期筛查与精准诊断能力。

OphVLM-R1 作为系统的底层 AI 引擎,采用轻量化设计,仅 2B 参数量却具备深度的眼科专业推理能力,支持眼底照片、光学相干断层扫描(OCT)、眼前节照片等多种眼科影像类型的解析。

系统基于ReAct(Reasoning + Acting)架构,集成了五大专业 AI 智能体——智能问答、病灶定位、辅助诊断、报告生成与眼科知识库,覆盖从影像分析、疾病诊断到报告撰写、知识查询的全流程诊疗需求。这种模块化设计不仅符合医生的临床思维模式,降低了 AI 系统的使用门槛,更实现了诊疗决策的可解释性与可追溯性,打破了传统 AI 模型“黑箱操作”的局限。

项目还构建了高质量眼科多模态推理数据集 OphReason-Vision,为模型训练提供了坚实支撑。整个方案从数据构建、模型训练到系统应用形成闭环,既保证了技术的先进性,又兼顾了临床的实用性,为眼科 AI 的临床落地提供了可行路径。

相关链接

灵瞳眼科智慧诊疗系统应用演示视频:

https://www.bilibili.com/video/BV1g4UTBZEEm/

灵瞳眼科智慧诊疗系统项目开源代码地址:

https://github.com/QiZishi/OphAgent/

OphReason-Vision 数据集开源链接:

https://www.modelscope.cn/datasets/MoonNight/OphReason-Vision

Intern-S1 开源链接:

https://github.com/InternLM/Intern-S1

InternVL 开源链接:

https://github.com/OpenGVLab/InternVL

书生大模型在线体验链接:

https://chat.intern-ai.org.cn/

联系方式:

huxy@hust.edu.cn, qizishi@hust.edu.cn

技术实现

数据集构建:高质量推理数据的生成闭环

图片

OphReason-Vision 数据集制作流程

为解决眼科多模态数据异构性强、推理逻辑缺失的问题,我们设计了“数据标准化-结构化推理合成-专家协同优化”的三阶段闭环管线。

在数据标准化阶段,团队整合了 10万 余例真实临床病例与 30 多个公开眼科数据集,涵盖 50 多种眼科疾病。针对病历文本与影像数据的模态差异,采用双流并行处理:一方面通过 MinerU 智能引擎解析非结构化 PDF 电子病历,提取标准化临床实体;另一方面利用 InternVL3-78B 视觉大模型为仅含离散标签的影像生成详尽的视觉描述,实现文本与视觉信息的深度对齐。

在结构化推理合成阶段,引入 Intern-S1 科学多模态大模型作为核心推理引擎,依据真实临床诊疗路径,自动生成涵盖“病灶定位”、“多模态诊断”、“医学知识问答”的多维指令数据,并强制模型遵循“视觉征象识别-医学知识检索-病理机制分析-临床决策制定”的标准化路径,生成逻辑连贯的思维链(CoT)。

为保证数据质量,我们引入“LVLM-as-a-Judge”机制,由眼科临床金标准驱动的裁判模型对生成内容进行实时质量校验,仅保留符合医学逻辑的高置信度样本。

最后在专家协同优化阶段,眼科专家对标记的困难样本与长尾罕见病样本进行二次审查修正,并将修改意见反馈给裁判模型。根据基底模型对样本的困惑度与推理复杂度,将数据集划分为基础知识层、核心能力层与高阶推理层三个难度层级,构建难度感知的动态数据池,为后续渐进式训练奠定基础。

模型训练:两阶段渐进式强化学习架构

我们以 InternVL3-2B 为基座模型开展训练。模型训练采用“冷启动监督微调+渐进式课程强化学习”的两阶段架构,兼顾了基础能力与深度推理能力的培养。第一阶段为冷启动监督微调(Cold-Start SFT),鉴于通用基座模型缺乏眼科专业知识,团队采用低秩自适应(LoRA)技术对模型进行轻量化全量微调,以最小的参数更新代价快速注入眼科解剖学、病理学及诊疗规范等领域知识。

图片

OphVLM-R1 模型训练架构

第二阶段为渐进式课程强化学习(Progressive Curriculum RL),核心目标是激发模型的深度推理能力并抑制幻觉。团队引入解耦截断动态策略优化(DAPO)算法,通过解耦策略网络与价值网络的截断约束,解决大规模强化学习中常见的梯度停滞与熵崩溃问题。

训练过程中采用由易到难的四阶段渐进式课程:从基础的“病灶定位”任务,逐步过渡到“多图选择”、“开放式图文问答”,最终完成“眼科知识问答”任务。每个阶段配备混合奖励函数,结合可验证规则奖励函数与 Intern-S1-mini 裁判模型。

针对医疗数据长尾分布问题,设计“困难样本动态回溯”机制,自动标记反复失败的样本并推入优先经验回放缓冲区,通过加权重采样强制模型“复习”,直至模型能稳定正确推理,显著提升了模型对疑难杂症的鲁棒性。

系统架构:ReAct 驱动的多智能体协同系统

“灵瞳”系统基于 ReAct 架构构建,实现了“推理-行动”的闭环循环,让 AI 决策过程可解释、可追溯。

系统采用前后端分离设计,后端基于 FastAPI 框架搭建,支持异步高并发处理与自动 API 文档生成;通过 SQLModel 统一数据验证与数据库模型管理,选用 SQLite 作为轻量级数据库,降低部署成本;集成 WebSocket 实现实时通信,支持 AI 响应的流式输出,提升用户体验。

前端采用原生 JavaScript ES6+ 开发,无框架依赖确保系统稳定性,响应式设计可适配桌面与移动设备,每个智能体配备独立的 UI 组件,模块化程度高。

五大智能体均遵循 ReAct 工作模式:接收指令后先进入推理阶段(Reasoning),分析任务需求、调用相关资源(如医学知识库、影像处理工具),再进入行动阶段(Acting),输出具体结果。

例如病灶定位智能体会先扫描影像识别异常特征、评估病灶类型,再输出标准化的边界框坐标、病灶类型与置信度;辅助诊断智能体会结合影像表现与临床知识推理可能疾病,再输出含置信度、诊断依据的结构化建议列表。

主控 Agent 能根据医生指令自主规划任务路径,如先调用定位智能体确认病灶范围,再调用诊断智能体分析病因,最后由报告智能体生成完整报告,实现从被动工具到主动“智能诊断伙伴”的转变。

示例

数据集示例:

图片

OphReason-Vision数据集示例

系统应用演示:

图片

智能问答智能体应用示例

图片

报告生成智能体应用示例

总结

本项目通过数据集创新、模型训练方法优化与系统架构设计,系统性解决了眼科 A I领域的核心痛点,实现了从技术研发到临床应用的完整落地。

在数据层面,构建的 OphReason-Vision 数据集首次实现了眼科多模态数据的深度对齐与结构化推理链的标准化生成,为垂直领域模型训练提供了高质量数据支撑。

在模型层面,两阶段渐进式训练架构结合 LoRA 微调与 DAPO 算法,让轻量化模型具备了超越更大参数量模型的专业推理能力,既降低了部署成本,又保证了性能表现。

在应用层面,基于 ReAct 架构的多智能体系统打破了传统 AI 的功能局限,实现了诊疗流程的全场景覆盖与决策过程的透明化,更贴合临床实际使用需求。

“灵瞳”眼科智慧诊疗系统的推出,为优质眼科医疗资源的普惠化提供了技术可行、成本可控的解决方案。其轻量化模型设计便于在基层医疗机构部署,可有效缓解基层医生专业经验不足的问题;可解释的决策过程增强了医生对 AI 的信任度,促进了人机协同诊疗模式的形成;全流程的智能辅助功能则显著提升了诊疗效率与准确性,对降低致盲性眼病的误诊漏诊率具有重要意义。

未来,随着因果推断机制的引入与数据集的持续优化,系统将在复杂、罕见临床场景下的诊断可信度与安全性方面进一步提升,推动眼科人工智能向更高水平的临床实用化迈进。

本项目的顺利推进离不开书生大模型生态的关键支撑,其在数据构建的视觉描述生成、模型训练的推理能力赋能等核心环节为团队提供了坚实技术基础。我们诚挚欢迎广大同行携手合作,围绕眼科 AI 的技术迭代、临床落地与数据优化深化探索,共同推动领域发展,让智能诊疗更好服务基层医疗、守护大众眼健康。


更多推荐