ClinConsensus 中文医疗榜单发布:GPT-5.2 居首,跨过门槛只是第一步

评测背景
大模型在健康科普、用药咨询等场景已经能给出像模像样的回答,但面对真实的复杂病例,模型究竟是在输出流畅的通用文本,还是真的能完成安全、完整且临床合理的诊疗建议?中文医疗场景正适合检验这种能力——诊断推理、治疗方案、随访管理环环相扣,任何一处遗漏或不当表述,都可能影响回答的临床可用性。
ClinConsensus 是为检验这类能力而构建的大模型评测基准,聚焦复杂临床问答、诊断推理、治疗建议与随访管理等关键能力。它以真实脱敏临床案例为题,将评测重点从“回答是否合理”推进到“回答是否逐条满足临床要求”,旨在检验模型在真实复杂医疗场景中的决策稳定性与输出合规性,探索真实临床使用价值。
本次晓天衡宇中文医疗榜单覆盖 11 款国内外主流大模型。每款模型都完成同一套 2500 个真实病例,每个案例配有专家预先设定的 30 条评分准则,从安全性与可执行性、临床合理性与完整性、沟通质量三个维度对回答提出要求,以考查大模型在真实临床语境下的综合表现。
榜单概览


点击访问晓天衡宇评测社区,查看完整榜单、排行榜规则、评测集详情、详细得分榜单。
核心结论
结论 1:GPT-5.2 独自领先,所有模型均未达到 33 分
本期榜单中,GPT-5.2 以 32.90 分位居第一,领先第二名 Baichuan M3 5.08 分,但整体分数仍处于低位。11 款参评模型平均分 24.14,榜尾模型Grok 4.1 Fast 仅 17.76 分。
结论 2:榜单中部得分高度相近,尾部断层清晰
榜单中部呈现高度密集的格局:
第二梯队 Baichuan M3、Claude Opus 4.6、Qwen3.5 Plus 等三款模型排第二至第四名,得分集中在 26.68—27.82 分,其中 Claude Opus 4.6 与 Qwen3.5 Plus 仅差 0.18 分。
排名第六的 Qwen3-Max 与排名第七的 DeepSeek V3.2 更是只差 0.04 分,在这一区间内,小数点层面的差异不具实质区分意义。
与之对照的是榜尾明显断层:第十名 20.05 分与第十一名 17.76 分差 2.29 分,提示尾部模型与中部梯队之间存在明显差距。
结论 3:模型差距集中在复杂案例,覆盖深度才是分水岭
通过逐题分布,可看出模型间真正的能力差距集中在复杂案例上:
GPT-5.2 命中准则不足 10 条(该题记 0 分)的题目仅占 11.48%,约每 9 题才有 1 题完全未达门槛;而榜尾 Grok 4.1 Fast 的这一比例达 32.28%,约每 3 题就有 1 题记 0 分。
同时,GPT-5.2 命中 20 条以上准则的高覆盖题目,占 22.64%,明显高于其余十款模型。头部与尾部模型的差距不在于常规案例能否达到基本覆盖,而在于复杂案例中能否在医生校准阈值之上保持持续覆盖。
评测设计
晓天衡宇本次评测基于 ClinConsensus 。该评测集包含 2500 个中文开放式医疗案例,覆盖 36 个医学专科、12 类任务主题、多档难度,以及面向普通用户和医疗专业人员的不同对话场景。每个案例均配有 30 条病例特定的评分准则,整套评测共包含 75000 个评分判断点。采用 GPT-5.1 strict judge 作为主评分器,对模型回答逐条给出命中判定,再汇总计分。
评测维度
本评测采用基于专家 Rubric 的开放式问答判分方式,每个案例的 30 条准则归入以下五个维度组:

十二类任务主题
评测集覆盖的十二类任务主题按主榜单分项归为 4 大类,另有医疗随访 1 类:

从任务分布看,本评测集更强调真实临床使用价值,其中“个性化方案生成”、“鉴别诊断”、“病历内容理解”等高价值任务占比较高,能够较好反映模型在复杂医疗决策场景下的能力上限与短板。
复杂度分层
数据集按复杂度划分为三个等级,以支持分层评测;构建过程还采用两阶段质量控制,以保证数据质量:

评测方法
样本依据临床任务与专科跨度划分为 L1—L3 三级复杂度,评分采用论文主指标 CACS@10(Clinician-Anchored Coverage Score,阈值 k=10):每题命中少于 10 条 rubric 记 0 分,达到 10 条后每多命中一条增加约 4.76 分。通过单例 30 条专家准则的全量覆盖,严格量化模型在真实复杂医疗场景中的决策稳定性与输出合规性。
Rubrics 总体命中率作为辅助参考指标,不参与排名。整体评测流程包括三层:样本构建与质控、评估标准设计、逐条判定与计分。
第一层:样本构建与质控
样本由中国临床专家团队根据真实病例或临床经验构建,并经过去标识化处理,以保证医学真实性和场景复杂性。
构建过程采用两阶段质量控制:首先利用多个强模型筛除过于简单的案例,其次由资深医生进行抽检审核,确保案例内容、评估标准和参考答案的临床合理性与一致性。
最终样本根据任务数量和涉及专科数量划分为 L1—L3 三级复杂度,用于分层评测。
第二层:评估标准设计
每个案例配有 30 条专家制定的评估标准,整套评测累计 75000 个评分判断点,覆盖安全性、完整性、临床合理性、可执行性、沟通质量五个维度。
评测采用 GPT-5.1 strict judge 作为主评分器,并使用经医生监督的 Qwen 3-8B judge 进行一致性、稳健性和本地部署验证来确保数据的准确性。
第三层:逐条判定与计分
模型的回答逐条对照每个案例的 30 条标准,每一条是否被满足都会被逐一判定,再汇总计分。
基准统计了 285 个医生的回答,医生平均可满足 10 条准则,因此把 10 条设为计分门槛:
-
模型在某一题上满足的准则少于 10 条,该题目计 0 分;
-
达到 10 条后,每多满足一条,加约 4.76 分;
-
30 条全部满足,记满分 100 分。
榜单最终得分由模型在全部判定点上的评分结果汇总计算。分数越高,表示模型回答整体满足专家准则的程度越高。
详细评测规则与方法,请前往晓天衡宇垂直领域评测榜单查看。
分析与结论
复杂医疗场景仍是大模型能力提升重点
本次评测任务对模型的综合医疗推理能力提出了较高要求。除基础医学知识理解外,评测还涉及病例信息分析、多步推理、医学文本理解以及高标准 rubric 对齐等能力。
本次评测按照真实临床场景构建:案例覆盖预防、治疗和长期管理三个医疗阶段,并设置了面向普通用户和医疗专业人员的不同对话场景。
评测结果显示:多数模型在大部分案例上已经能够命中相当比例的专家准则,给出基本可用的回答。但在复杂病例中,实现深度、完整且稳定的准则覆盖仍是共性挑战。
不同任务类型难度差异明显,信息理解能力成为关键挑战
根据 ClinConsensus 评测集的主题分类,12 类任务主题呈现清晰的难度分化:模型在常见疾病科普、病情跟踪随访、鉴别诊断、个性化方案生成等任务上相对更容易取得较高表现;医学命名实体识别、临床文档摘要生成、医学信息抽取等任务则更具挑战性。
这表明,医疗大模型的能力提升不仅依赖知识覆盖,更取决于复杂场景下的信息理解、组织与推理能力。尤其在长病历理解、复杂案例结构化组织及高标准要求下的稳定输出方面,模型仍有进一步提升空间。
综合判断
本次评测结果表明,当前大模型在中文医疗场景下已具备一定案例回答能力,但整体覆盖深度仍然有限:11 款参评模型中没有模型达到 33 分,平均分仅 24.14。
模型间差异主要体现在复杂案例处理能力上:部分模型能够完成基础信息理解和部分准则覆盖,但在高要求场景下持续保持完整、准确的回答仍存在挑战。
从临床应用视角看,跨过基础回答门槛只是第一步,如何提升复杂病例中的高合规、高覆盖和稳定输出能力,仍是医疗大模型进一步发展的关键方向。
注:本文结论基于晓天衡宇本期评测体系与样本,反映模型在该评测框架下的相对表现,不代表所有业务场景中的绝对优劣。
写在最后
最新垂类领域模型评测榜单已同步上线至晓天衡宇评测社区官网,欢迎访问查看更详细的评测数据

更多推荐




所有评论(0)