本项目依托大数据与AI技术,对全市多家医疗机构的海量诊疗数据进行深度标准化治理,并构建集存储、治理与应用为一体的知识平台。通过建立专病库与医学知识图谱,旨在赋能临床科研、辅助政府决策,并带动区域健康医疗产业协同发展。

一、项目总体概述

本项目旨在运用医学大数据及人工智能技术,对全市医疗机构的诊疗数据进行深度治理,将非结构化的医学文本处理为归一化、结构化、标准化的医学数据,建立统一的数据模型和医学知识图谱,打造集数据治理、开放、应用、运营于一体的健康医疗大数据平台。

二、建设背景与现状

2.1 现有基础

  • 人口规模:全市常住人口411万,医疗机构总数1804个(公立568个),其中医院54个,基层医疗机构1713个。

  • 业务量:2018年总诊疗人次达3644.88万人次,入院人数605956人。

  • 信息化现状:已建立市级统一的区域医疗信息化平台,采用OGG数据采集方式完成对346家医疗机构的数据采集,数据总量50TB,包含约1514万名患者、1.6亿次就诊记录,月新增约250万条就诊数据。

  • 已开展应用:预约挂号、院外候诊、个人健康档案查询、用药信息监测等,但仅停留在原始数据的简单查询和统计阶段。

2.2 现存主要问题

  1. 数据资源缺乏整合:数据形态、标准、存储格式各异,未能汇集成统一资源。

  2. 数据质量参差不齐:存在有指标无数据、有数据不标准、有标准不准确等问题。

  3. 数据应用程度不深:仅解决业务规范性和效率问题,缺乏深层次规律挖掘和知识提炼。

  4. 数据服务缺少平台:缺乏面向企业、产业的健康医疗大数据基础平台和开放平台,产业带动成效不显。

三、项目建设目标与规模

3.1 五大目标

  1. 构建统一的数据资源标准规范体系:按照国家、省、市相关标准,建立数据治理全生命周期的规范体系。

  2. 提供数据清洗加工服务:对已采集的健康医疗数据进行粗加工、精加工,去除"脏"数据,开展组合、关联、分析和可视化处理。

  3. 构建数据资源共享开放体系:实现跨区域、跨层级、跨部门、跨领域的数据共享和开放。

  4. 提升临床科研数据服务能力:为医学科研、辅助诊断、趋势分析提供数据支撑,帮助精准分析和科学决策。

  5. 推进健康医疗产业发展:逐步探索行业数据共享应用服务,培育大数据核心业态、关联业态,形成产业生态体系。

3.2 建设规模

  • 覆盖全市16家三级以上医院39家基层社区卫生服务中心的诊疗数据,覆盖全市95%以上具有科研职能的公立医疗机构,数据量约30-35TB

  • 数据范围:HIS、EMR、LIS、PACS、体检、心电系统及云HIS、移动家庭签约系统的历史数据和实时新增数据。

四、建设内容

项目包含三大板块

4.1 大数据基础平台

基于主流Hadoop分布式架构,提供TB/PB级别数据的离线和实时处理能力,具备海量数据快速处理能力,提供数据集成、数据开发、算法开发等可视化一站式开发平台。

4.2 健康医疗大数据治理服务

  1. 数据生产处理体系:基于海量医学数据治理经验,对数据进行自然语言识别、医学术语归一、数据结构化处理。

  2. PDCA持续治理体系:建立数据质控规则,对采集、处理、应用过程中的数据进行表级、字段级持续治理。

  3. 数据开放体系:对数据采集、生产、治理等基础服务进行封装,面向未来业务拓展提供专业数据服务。

  4. 科研架构:构建基础临床数据治理和专科数据治理为一体的医疗数据科研架构,打造疾病协同网络。

4.3 健康医疗大数据知识应用平台系统

面向政府监管机构、医学院校、医疗机构、科研人员开放使用,结合某市专科优势选取3种专科病种构建专病数据库。系统功能包括:

  • 医学科研探索发现

  • 区域疾病知识图谱

  • 海量病历极速检索和分析统计

  • 科研项目管理

  • 科研患者数据管理

  • 医学知识全库

五、技术架构与路线

5.1 系统框架

整体架构为:数据采集层 → 数据治理层 → 应用支撑层(Hadoop/K8s/Elasticsearch/Kylin/安全管理) → 知识应用平台层 → 用户层。部署在某市卫健委医疗云,集群间通过核心交换机互联。

5.2 核心技术路线

技术领域关键技术应用场景
数据标准化ICD-11映射、基准表映射+人工标注医疗术语归一化
多源异构治理智能识别异构数据结构、关联辨析跨系统数据整合
自然语言处理(NLP)分词、消歧、模版匹配、语义分析、规则过滤电子病历非结构化数据结构化
大数据治理机器学习规则、嵌套规则、组合规则、数据字典规则数据清洗、转换、关联、质控
联机分析处理(OLAP)Kylin多维立方体(MOLAP Cube)海量数据秒级查询
微服务架构Kubernetes(Docker容器编排)应用部署、资源调度、服务发现
分布式存储计算Hadoop(HDFS+MapReduce+YARN)海量数据分布式处理
NoSQL存储HBase(列存储)、MongoDB(文档存储)非结构化数据存储
消息系统Kafka前置机到治理集群的数据传输
数据迁移SqoopRDBMS与Hadoop间数据导入导出
安全体系PKI公钥基础设施身份认证、数据加密、数字签名
数据可视化多维数据图形化展示分析结果呈现
数据挖掘疾病图谱、数据仓库规律发现、决策支持

5.3 Hadoop生态系统

数据存储于HDFS,使用Sqoop进行数据导入;数据仓库使用Hive和InceptorSQL;计算引擎使用YARN、Spark和SlipStream;处理完毕的数据存放于Kylin和HBase;中间有Kafka进行数据传输,Azkaban进行数据调度。

六、数据治理详细方案

6.1 治理流程

数据生产 → 数据归一 → 数据对账 → 数据质量评估与反馈 → 问题数据更新

  • 数据生产:按元数据结构生产符合规则的数据,含超时报警、重试出错报警。

  • 数据归一:将数据项进行值域归一,自动映射失败时人工介入。

  • 数据对账:T+1增量数据与前一天实时数据进行对账,偏差范围±1%内为成功。

  • 增量更新机制:每天一次增量更新(T+1),每7天一次全量更新。

6.2 PDCA质量改进闭环

  • Plan(计划):从完整性、唯一性、关联性、字典一致性、值域约束、逻辑性、规范性、可用性8个维度评估。

  • Do(执行):通过平台配置工具进行数据质控。

  • Check(检查):质控模块调用质控规则库进行质量评估。

  • Act(处理):事件处理流程 + 任务处理流程 + 配置更新流程,形成两个闭环(数据质量改进闭环、配置优化改进闭环)。

6.3 数据治理服务内容

  1. 数据调研服务:摸排调研 → 详细调研 → 调研报告编制,含业务梳理、调研表设计。

  2. 数据统一/标准化/规范化:主数据管理、元数据管理、数据模型设计(物理模型/概念模型/主题域模型)、代码字段标准化(参照ICD-11等标准)。

  3. 数据汇聚服务

    • 数据获取方式:数据仓库备份方式、日志解析方式、数据API服务方式

    • 备份策略:全量备份+增量备份/差异备份组合策略

    • 数据脱敏:动态脱敏+静态脱敏(不可逆),脱敏对象包括患者信息(姓名、身份证、电话、住址等)、医务人员信息、医疗机构信息

    • 数据抽取:前置机数据向Hadoop数据仓库迁移

  4. 智能化治理服务:基于NLP的结构化处理,正则抽取+通用框架(分词、消歧、模版匹配、语义分析),覆盖症状、体征、烟酒情况、病理诊断等字段。

6.4 数据质量评估指标

评估指标计算方法维度归属
空值率空值数/值总数完整性
空字段率空字段数/字段总数有效性
数值重复率重复数值数/数值总数重复性
值域合法率合法值数/有值总数合法性
业务主键唯一性唯一值数/数值总数合法性

七、知识应用平台功能详述

7.1 疾病探索

  • 疾病图谱:多层级关系网络,节点大小与统计类型权重相关,包含伴随诊断、用药、手术、检查、检验、症状六类关键词,支持下钻查看。

  • 疾病特征分布:对选定疾病按性别、年龄、伴随诊断、症状/体征、用药、手术、检验、检查进行分布统计。

  • 疾病指标趋势:支持半年/一年/三年趋势分析,含门诊人次、住院人次、平均住院日、手术例数、TOP5用药/手术/检查/检验。

7.2 病历搜索

  • 关键词搜索:按用药、诊疗、基本信息、检查、检验、出院记录等维度检索,支持病历/患者两种视图,左侧提供多维度筛选。

  • 高级搜索:支持AND/NOT/OR逻辑组合,含搜索主题(诊断/用药/检验/检查)、值域范围,支持患者维度和就诊维度两种粒度。

  • 条件树搜索:支持节点间"且""或"逻辑组合,支持纳入/排除组合,支持"同病人""同病历"两种筛选粒度。

  • 事件搜索:在条件树纳排范围内进行二次事件搜索,支持相对/绝对时间、发生次数限定,支持T0事件定义(诊断/手术/用药医嘱/检验/检查/就诊),支持累计/连续/任意三种次数计算方式。

7.3 搜索结果可视化

支持表格化展示、自定义显示指标,可导出至研究项目;支持多维度统计分析并以统计图形展现;支持搜索历史记录和结果收藏。

7.4 患者全景视图

  • 时间轴:所有就诊信息的图形化总览,含诊断、用药、手术、检查、检验等,支持时间滚动条调整范围。

  • 就诊信息:按时间顺序排列所有门诊/住院/急诊数据。

  • 检验:按检验单样式显示,支持就诊类型、标本、结果筛选,支持指标名称搜索。

  • 检查:按检查类型、部位汇总,支持同类型/同部位跨时间比较。

  • 病理:含基本信息、肉眼所见、病理所见、病理诊断。

  • 手术:含手术基本信息、诊断、麻醉、术中用药、手术过程描述。

  • 文书记录:病案首页、入院记录、出院记录、死亡记录、首次病程、查房记录、会诊记录单等。

  • 医嘱:含时效、剂量、频率、下医嘱科室等信息,支持按时效/科室/频率筛选。

7.5 患者分析

从医生维度、科室维度、医院维度对诊断、手术、检查、检验等诊疗数据进行分析,支持以治疗角色(术者、主治医生)为视角,多种统计图形展示。

7.6 研究项目管理

  • 项目基本信息设置:项目名称、起止时间等。

  • 患者入组设置:系统纳排(纳入/排除标准)+ 人工导入(姓名、病案号、住院号等)。

  • 观测指标设置:支持上千量级标准化指标选取、按相对医疗事件基线时间定制化选取、结构化编辑器智能提取。

  • 结构化编辑器:支持是否型、数值型、特征型三种字段类型,支持手工标注和智能提取(一键提取当前页/所有页)。

  • 研究对象详情:传统视图(入组途径、病案号、性别、病历数、诊断数等)+ 多维视图(基础信息表+观测指标表)。

  • 数据导出:支持多种格式,按患者基本信息、诊断、用药、检验、检查、手术、病理分Sheet展示。

7.7 研究项目数据开放与共享

支持API申请(选择数据内容、申请有效期)→ 后台审批 → 生成Webservice格式API接口。

7.8 在线统计分析

支持描述性统计分析,分类型变量以表格(分类名称、总数、占比)+ 统计图(饼图、条形图)展示;连续性数据以频数直方图/箱线图展示,含均值、标准差、中位数及正态分布检验结果。

7.9 重要疾病领域重点指标地图

基于癌症、心血管、呼吸、内分泌等领域TOP疾病,展示医学核心观测指标统计结果(如肿瘤领域:入院时间统计、诊断名称、性别、T/M/N分期、转移部位等)。

7.10 知识全库

  • 知识推荐:根据医生/科室诊疗疾病进行个性化推荐(含万方和PubMed多数据源),标注推荐理由。

  • 研究热点趋势图:近十年相关疾病研究中不同TOPIC的河流图,支持点击关键词查看具体文献。

  • 文献:中英文切换、相关性/时间排序、文献热度统计、相关搜索词推荐、关联患者/病历数量查询、高级搜索(主题/关键词/摘要/作者/单位/期刊/发表时间)。

  • 指南共识:按指南/共识/解读分类,中文/英文/译文筛选,年份筛选。

  • 临床路径:支持检索与下载。

  • 药品说明书:按药品名称检索,查看详情。

  • 临床试验:ClinicalTrials + ChiCTR双来源,按来源/试验类型/招募状态筛选。

  • 误诊误治:累计不少于2500种病例,支持疾病分类与推荐。

八、信息资源规划与数据库建设

8.1 数据仓库架构

ODS层(数据缓冲层) → EDW标准层 → EDW分析层 → CDM/ADM(数据集市层) → 数据应用层

  • ODS层:保存原始业务系统数据,按原始表结构建立。

  • EDW标准层:统一数据格式、字段命名、数据字典,清洗整合,按主题划分,提供最细粒度基础数据。

  • EDW分析层:混合模型(关系模型+维度模型),提供可分析数据,支持粒度提升。

  • CDM:通用指标模型,维度模型为主。

  • ADM:面向特定部门/团队/应用的数据子集,按具体应用划分。

8.2 数据建仓工作流程

资源准备 → 数据梳理准备(ODS/DWD/DWS/ADS/DIM表梳理)→ ODS层建设 → DWD层建设(清洗转换、去重、一致化)→ DWS层建设(基础标签生成、统计汇总)→ ADS层建设(按业务需求组织数据)→ DIM维度表建设(标准表+映射表)→ 工作流配置(初始化+调度)→ 发布生产环境。

8.3 主题数据库(102类数据范围)

数据库名称核心内容部分关键数据项示例
门诊信息库患者门诊就诊信息文档名称、医疗机构名称/代码、患者标识、就诊标识、患者基本信息、挂号信息(挂号时间/科室/医生)、分诊就诊信息、就诊状态、医保险种等(74项)
住院信息库患者住院就诊信息住院登记基本信息、病房床位信息、主管医师信息、入院/出院时间、入/出院科室、住院状态、医疗保险类型等(74项)
医疗费用信息库患者费用结算信息门诊/住院费用细目、发票信息、收费项目编码/名称、收费单价/数量/总金额、医保等级、个人承担金额、医保支付金额、基金/个人账户支付等(67项)
药品信息库医院各类药品相关信息药品名称/规格/剂型/生产厂家、处方信息、药品类医嘱、医嘱执行频率、用药途径/剂量/总用量、抗菌药物标识、中药配方等(67项)
电子病历信息库住院电子病历文书入院记录、一诉五史(主诉/现病史/既往史/个人史/婚育史/家族史)、体格检查、入院检查结果、中医四诊、辨证分析、诊断信息等(94项)
病案信息库住院病案首页住院基本信息、入出院信息、诊断(门急诊/入院/出院/病理/中医)、手术操作信息、离院方式、住院费用(按大类细分共40+项费用)等(246项)

九、非功能性需求

  • 可靠性:7×24小时不间断服务,系统可用率≥99.99%(年不可用时间<9小时)。

  • 可扩展性:支撑基础设施、软件结构、数据库功能不断扩展,满足容量和用户数增长。

  • 网络性能:核心设备/线路冗余,整网带宽满足高峰期需求,支持QoS策略,全网统一网管。

  • 大数据存储与计算:基于Spark/Hadoop构建,支持TB/PB级数据处理。

  • 海量数据秒级查询:采用Kylin、ES、MongoDB等满足高可用、高并发、高负载需求。

  • 数据备份:完善的备份和恢复机制,保留处理痕迹,确保数据可溯源。

  • 信息安全:遵照"层次化管理、多级防范"思路,做好网络层、主机层、数据库层的安全防护,保障数据原始性和完整性。

十、网络与安全建设

10.1 网络架构

平台统一部署在某市卫健委医疗云,平台本身划分为多个集群进行部署,集群间通过核心交换机互联,实现数据和请求的打通。

10.2 安全体系

信息安全等级保护三级(等保三级) 要求和《政务信息资源共享管理暂行办法》为指导进行设计:

安全层面主要内容责任主体
物理和环境安全机房防震/防火/防水/防静电/温湿度控制/电力供应/电磁防护云平台/承建方
网络和通信安全网络架构、通信传输、边界防护、访问控制、入侵防范、恶意代码防范、安全审计、集中管控云平台
设备和计算安全身份鉴别、访问控制、安全审计、入侵防范、恶意代码防范、资源控制云平台/承建方
应用安全授权管理(功能权限+数据权限)、日志审计、代码安全、身份鉴别、访问控制、安全审计、软件容错、资源控制承建方
数据安全数据采集安全、数据治理安全(身份认证/活动日志/权限控制/敏感度分级/沙箱机制)、数据存储安全(3副本容错、租户隔离)、数据开发安全(脱敏、代码加密)建设单位

云平台采购安全服务:DDoS攻击检测、Web攻击监测(SQL注入/XSS/上传漏洞)、紧急事件分析、服务器安全(基线检查/后门查杀/异地登陆告警/暴力破解检测)、补丁管理、威胁分析、弱点分析(应用漏洞/主机漏洞/弱口令/配置项检测)、情报收集、数据灾备。

十一、组织架构与人员配置

11.1 领导和管理机构

项目建设领导小组 → 领导小组办公室(下设任务保障工作组 + 技术统筹工作组)→ 业务子系统工作小组(各业务处室)

项目管理机构为某市健康医疗大数据中心,负责宏观方向把控、资源协调、重大决策、方案审查与批复。

11.2 项目实施组织架构

项目领导组 → 项目专家组 + 项目标准组 + 项目总负责人 → 项目负责人 → 组织管理团队 + 项目咨询组 + 项目技术组 + 项目工程建设组(硬件/软件/集成小组)

11.3 人员配置(共16人)

岗位人数技术职称
项目管理人员1高级工程师1
网络技术人员2工程师1
安全技术人员2高级工程师1
大数据治理系统技术人员3高级工程师1
应用运维人员2高级工程师2
数据库管理人员2高级工程师1
数据录入与采集人员4工程师4
资料整理人员2工程师2

11.4 人员培训

  • 培训对象:管理人员、业务人员、技术人员三类。

  • 培训内容:计算机应用基础、系统管理培训(网络管理/系统安全/数据库管理/应用系统管理和维护)。

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

更多推荐