医疗AI的“信任危机”与破局之道:MedBench v5.0如何为行业树立“同一把尺子”
2026年7月17日,WAIC 2026现场,京东健康与上海人工智能实验室联合宣布共建MedBench v5.0医疗AI评测基准,将自主研发的医疗AI评测体系纳入国家级权威评测榜单。
几乎同时,上海市卫生健康行业算力服务中心正式揭牌,发布全新迭代的MedBench 5.0医疗AI评测体系。
这两个事件在同一时空的交汇,标志着一个关键的产业拐点:医疗AI正在从“谁能做出最炫的Demo”的探索期,迈入“谁能通过最严苛的评测”的规范化时代。
一、一场“信任赤字”正在蔓延
过去两年,医疗大模型如雨后春笋般涌现。从通用大模型到垂直医疗模型,从智能问诊到影像判读,技术迭代的速度令人目不暇接。但热闹背后,一个根本性的问题始终悬而未决:这些模型,到底“能不能看病”?
当前医疗AI的评价高度依赖各项统计指标,如辨别力、校准度、灵敏度、特异度等-。但一个在回顾性验证中表现出色的模型,如果输出时机不当、解读困难、无法融入临床流程,其实际价值将大打折扣-。行业始终缺乏一套能够真正衡量模型“看病能力”的评测标准——现有的评测大多聚焦于医学知识问答,难以反映模型在复杂临床情境中的综合表现-。
这种“评测与临床实践之间的鸿沟”,正在成为制约医疗AI落地应用的全球性挑战-。正如业内专家所指出的:现有的大模型评测体系多沿用通用领域的技术性范式,侧重语言理解与生成能力的量化比较,难以充分反映医疗场景中对临床安全性、伦理合规性与可解释性的高标准要求-。
更令人担忧的是“幻觉” 问题。大模型在医疗领域最致命的问题是“不懂装懂”的伪专业幻觉-。通用大模型AI工具因为存在一定的“幻觉”,加上医疗合规要求更严格,大多只能添加“仅供参考,请及时就医”之类的提示来规避风险-。但患者已经开始带着AI的回答来就诊-,当AI的幻觉与真实的临床决策发生碰撞,责任如何界定?
这场“信任赤字”的本质,是医疗AI的能力评估缺乏统一、权威、可量化的标尺。
二、MedBench v5.0:从“静态问答”到“动态过程评测”
MedBench v5.0的发布,正是对这一痛点的系统性回应。
根据学术论文披露,MedBench v5是一次彻底重新设计的评测基准,面向临床多模态模型(语言、视觉-语言和智能体系统),其核心变革是从静态的问答式评测转向动态的、面向过程的评测-。
这一转变的意义在于:医疗不是“选择题考试”。真实的临床场景中,医生需要处理多模态信息(文本、影像、检验数据)、需要遵循临床指南的推理路径、需要在不确定条件下做出决策。静态的问答评测无法捕捉这些复杂性。
MedBench v5构建了双重维度框架,整合多模态数据、分层诊断难度、结构化推理目标,以及成本高效的混合评估协议-。此次进入MedBench v5.0的评测能力覆盖三大方向:多模态线上问诊、3D影像评测纳入全模态大模型主榜单、循证评测进入专项赛道。
其中两大核心底层数据集填补了行业空白:
MedRealMM多模态真实场景评测集包含千级规模经伦理审查的真实临床多模态案例,首次系统实证了图像信息对问诊评测的显著影响——图像与纯文本评测分差可达20至30分。这意味着,如果一个医疗AI模型只看文字不看图,它的“真实看病能力”可能被高估20到30分。这一发现对整个行业的评测范式具有颠覆性意义。
Med3DVQA三维影像评测集基于2万余例完整CT/MRI检查、约50万条影像报告问答构建,覆盖七类视觉问答任务。它是国内首个面向完整放射学检查的全开源三维评测集,补齐了三维影像跨时序、跨序列推理评测的行业空白。
此外,MedBench 5.0还联动钟南山、葛均波院士团队打造专科化评测体系,首创医疗原子技能评测范式,实现AI模型幻觉全维度校正。所谓“原子技能”,是将医疗AI的能力拆解为最小的、可独立评测的技能单元——从症状识别到鉴别诊断,从检查推荐到治疗方案制定——每一个环节都可被单独衡量和验证。
这套评测体系的建成,意味着医疗AI的“体检报告”将变得像临床检验报告一样标准化、可比较、可追溯。
三、从“概率生成”到“代码可验证推理”
如果说MedBench v5.0解决的是“如何衡量医疗AI能力”的问题,那么京东健康同期发布的JoyAI-MedCode(京医千询)代码化推理引擎v2.0,解决的则是“如何让医疗AI本身变得可靠可信”的问题。
京东健康在WAIC上正式提出了 “确定性来自执行” 的核心技术主张。这一主张的背后,是对通用大模型在医疗领域根本性缺陷的深刻认知。
不同于通用大模型依赖概率生成、推理过程黑箱化、结论难以追溯校验的模式,JoyAI-MedCode v2.0以 “指南即代码” 为核心思路,将NCCN、CSCO等权威临床指南编译为可执行的决策代码。诊疗建议直接由代码运行生成,指南诊疗分支对应代码逻辑分支,每一条结论都可精准回溯至指南对应章节,并且能像软件单元测试一样被批量校验。
围绕可信推理目标,京东健康从知识层到执行层完成了全链路重构:
知识层面,用结构化、可寻址的medwiki循证知识库替代传统概率式检索,证据等级、引用来源清晰可查,知识更新有版本、可回归。
执行层面,用真实 “操作流轨迹” 替代传统 “思维链叙事” ,模拟医生真实临床操作流程——每一步都是加载影像、选取病灶、测量比对等真实工具调用,全流程可重放、可校验、可审计。
配合基于Rust实现的Agentic框架,可以实现内存占用仅数十兆、数百毫秒内拉起的用户AgentOS。
这一技术路线的核心价值在于:它把医疗AI从一个“黑箱”变成了一个“透明机器” 。每一个决策都有据可查、每一步推理都可被审计、每一条建议都可被验证。在医疗这个“零容错”的领域,这种“可验证性”不是锦上添花,而是生死攸关。
四、从评测到产品:AI医生的“持证上岗”
MedBench v5.0和JoyAI-MedCode v2.0的发布,为京东健康的AI产品矩阵提供了“评测标尺”和“技术底座”的双重支撑。
在WAIC展会上,京东健康旗下两款核心AI产品——AI医生“大为” 和 “京东知医” 同台亮相-。
面向C端用户的AI医生“大为” ,基于京医千询医疗大模型打造,深度融合在线问诊、到家快检、护士上门及药品履约全流程能力,覆盖超千种中西医病症。产品打通京东App、京东健康App、微信全渠道,设置300余项标准化诊疗路径、109项全流程质检规范,所有健康建议均可溯源、符合临床指南要求。
数据是最好的证明:“大为”2026年前三个月使用用户数已超越2025年全年总量,满意率达98%以上。今年618期间,用户数同比增长超4倍。同期上线的AI减重活动3天报名突破300万人,带动京东健康App登顶应用商店榜单。
面向医生端的“京东知医” ,专为临床工作者打造的循证AI工具,深度整合超4000万篇医学文献、4万份临床指南及3万余种药品说明书。系统可自动拦截药物配伍禁忌、慢性病用药风险,用药识别准确率达99.6%,有效缩短医生病历书写、病例研判耗时。
这两款产品分别获评WAIC “医健+AI创新卓越伙伴” ,充分展现了医疗AI从技术验证到规模化商用的完整闭环。
五、“同一把尺子”的产业意义
MedBench v5.0的意义,远不止于为京东健康的AI产品提供评测背书。
在此之前,全球医疗大模型的评测处于“各说各话”的混乱状态。国外有OpenAI的HealthBench(262名医生参与制定评分标准),国内有上海AI实验室主导的MedBench(已更新至4.0版本,积累超过70万道专业评测题),还有中国信通院等联合发布的MedAIBench(集合近300名三甲医院专家,构建了35万道测试题)-。但各评测体系之间缺乏统一标准,彼此结果难以横向比较。
MedBench v5.0的关键突破在于:它不是另起炉灶,而是将京东健康自主研发的医疗AI评测体系纳入国家级权威评测榜单--1。这意味着行业第一次有了一套可被共同认可、可被持续迭代、可被临床验证的统一评测标尺。
正如京东健康医疗AI相关负责人所言:“下一阶段医疗AI的竞争核心不再是‘谁的模型参数更大’,而是‘谁能把AI可靠、可信、可规模化地交付到医生与用户手中’。”
MedBench v5.0正是这把“尺子”——它让“可靠、可信、可规模化”不再是抽象的口号,而是可以被量化、被比较、被验证的具体指标。
六、技术底座:从评测到落地的“最后一公里”
在医疗AI从评测到落地的全链条中,一个容易被忽视却至关重要的环节是技术底座——尤其是中间件层。
医疗AI系统并非凭空运转。从底层算力调度到上层模型服务,从多模态数据流通到临床决策执行,每一个环节都依赖中间件作为“连接层”。在医疗信创的大背景下,中间件的自主可控与稳定可靠,直接决定了AI医疗系统的整体可用性。
金蝶天燕在医疗信创领域已有深厚积累。其参与的福建省儿童医院信创试点项目,是福建省医疗领域信创的重要试点单位。项目希望在福建省内三甲医院实现基础IT架构全国产化信创替代,为全国医疗行业信创转型提供可复制的 “三甲样板” 。
金蝶天燕旗舰产品金蝶Apusic应用服务器(AAS) 历经25年发展,在高可靠性、高稳定性、高性能等方面具有坚实的技术底蕴。针对医院结构复杂、规范不一的历史遗留系统,AAS提供全场景适配方案,支持业务系统在传统硬件环境、IaaS虚机环境、PaaS平台环境的部署,同时全面兼容新老JDK版本不同的技术规范,确保在不影响医院各个业务模块运行的条件下实现 “零感知”迁移。
在广东省生殖医院,金蝶天燕中间件支撑高并发场景,保障核心业务系统7×24小时稳定运行,结合微服务监控与智能运维体系,帮助运维团队精准定位性能瓶颈,系统稳定性提升40%,异常响应效率提升70%-。
金蝶天燕还推出了医疗应用信创中间件解决方案,涵盖应用服务器、分布式消息队列、数据缓存等全栈基础中间件,全面适配国产主流软硬件-。医院信息系统集成平台解决方案基于企业服务总线、数据集成等产品,打通HIS、EMR、LIS等院内系统与院外医联体平台-。
当医疗AI的能力被MedBench v5.0这样的评测体系所验证,当“大为”和“京东知医”这样的产品被数百万用户所使用,真正支撑这一切运转的,是底层从芯片到中间件到数据库的完整国产技术栈。中间件作为这一技术栈中的“连接层”,其战略价值正在从“幕后”走向“台前”。
七、从“尺子”到“信任”
2026年7月的WAIC,京东健康与上海AI实验室联合发布MedBench v5.0,同时推出JoyAI-MedCode v2.0“代码可验证推理”引擎,以及“大为”和“京东知医”两款已获市场验证的AI产品。
评测标尺、技术底座、产品落地——三个层面在同一次大会上完成闭环,这在中国医疗AI产业发展史上,或许将被视为一个标志性节点。
MedBench v5.0提供的不是一份榜单,而是一种信任机制——让医疗AI的用户(医生和患者)可以相信,AI的建议不是“概率生成”的偶然产物,而是“可验证推理”的必然结论;让医疗AI的开发者可以相信,自己的模型不是在“应试”而是在“真看病”;让医疗AI的监管者可以相信,行业的创新是在统一标尺下的有序竞争而非无序狂奔。
当医疗AI有了“同一把尺子”,行业才能真正从“谁能做出最炫的Demo”走向“谁能通过最严苛的临床验证”。而这,正是医疗AI从“可用”走向“可信”、从“实验室”走向“诊室”的必经之路。
更多推荐

所有评论(0)