黄天荫团队提出医疗人工智能安全风险分级框架

文章面向医疗AI从研发试点走向常规临床应用的安全治理需求,提出S1-S4四级临床安全分类框架。

作者: 本站编辑 来源: 清华大学医学院、NEJM AI 2026-08-20 09:24:10

8月17日,清华大学副教务长、医学院院长黄天荫教授联合上海交通大学、斯坦福大学、伦敦国王学院和新加坡国家眼科中心等机构学者,在NEJM Group旗下医学人工智能期刊NEJM AI在线发表题为“A Classification of Safety Risks in Medical AI”(医疗人工智能安全风险分类)的观点文章。文章面向医疗AI从研发试点走向常规临床应用的安全治理需求,提出S1-S4四级临床安全分类框架。

 

在线发表截图

 

评价医疗AI是否安全,不能只看准确率或短期表现。文章指出,一些由AI引发的伤害可能在诊断或干预数月乃至数年后才显现。这些伤害难以追溯到最初的AI输出,但可能已经造成严重或不可逆的后果。因此,暂未观察到伤害,并不足以证明系统安全。

真正重要的问题是:当系统在新的患者群体、场景或工作流程中出现意外行为时,医疗机构能否及时发现、追溯并采取干预。

 

从S1到S4:让风险分类直接对应临床行动

 

文章借鉴了基于可判定性理论的R1-R3风险分类思路,将其转化为面向临床工作流的S1-S4分级。四个等级并非简单的性能评分,而是分别对应不同的验证、复核、随访和限制措施。

 

图表内容根据论文表1整理

 

同一模型,部署方式不同,安全等级也可能不同

 

该框架最关键的判断是:S等级不是AI模型本身的固定属性,而是具体部署方式的安全标签。等级取决于AI承担的临床任务、所嵌入的工作流程、服务的患者群体、能否持续跟踪患者的后续情况,以及医生能否在采取行动前进行有效复核与干预。

文章以此前发表的DeepDR-LLM研究作为真实临床工作流示例。DeepDR-LLM整合图像深度学习与大语言模型,用于基层糖尿病管理和糖尿病视网膜病变筛查。

当系统仅提供经医生复核、编辑的决策支持时,可视为S2;

当安全取决于患者是否完成眼科转诊及后续结局时,部署情境趋向S3;

若AI输出绕过临床判断,被用于拒绝转诊、延迟专科诊疗或直接指导高风险治疗,则可能接近S4。

该案例说明,同一项AI功能会因人类监督和后续照护条件不同而产生完全不同的安全要求。

 

从一次性评估转向多时间窗部署后监测

 

针对延迟伤害,文章提出多时间窗部署后监测:首先,在数日至数周内快速捕捉事件、近似失误和高风险输出信号。其次,在随后数月按具体用途设置结局核查点,例如30天、90天和365天。必要时,再通过登记系统、医保或理赔数据链接以及实施后研究,开展超过12个月的长期监测。上述时间点应根据临床用途调整,并非适用于所有AI系统的统一固定周期。

在责任分工上,供应商可提出初始S等级,并提供预期用途、人工监督、审计日志、监测接口和模型更新证据。但部署医疗机构应承担最终治理责任,并通过本地AI治理委员会或同等监督机制,在上线前确认等级。

此后,应在试点结束、到达预定监测节点,或出现预设触发情形时重新评估S等级。这些情形包括:适用人群或应用场景扩大,放宽医生复核要求,转诊、医嘱或出院等决策转为自动执行,数据分布或系统性能发生明显变化,患者随访或治疗结果追踪不到位,险情或不良事件集中发生,或供应商更新改变系统的预期用途或运行方式。

临床负责人和AI治理委员会应有权缩小系统的适用范围、暂停使用、撤销相关更新或恢复到此前的运行状态、重新分级,必要时禁止使用。

 

为现有医疗AI监管框架补充“时间维度”

 

文章强调,S1-S4框架旨在补充而非替代欧盟《人工智能法案》、国际医疗器械监管机构论坛的软件医疗器械框架,以及美国食品药品监督管理局、美国国家标准与技术研究院和世界卫生组织的相关指南。其主要价值在于,将伤害何时显现、医生何时必须复核、何时需要链接随访结局,以及谁有权暂停或回滚系统,纳入同一套临床治理逻辑。

论文最后指出,医疗AI不仅应以目前的表现或安全性来判断,还应看医疗系统能否发现、追溯并减轻它未来可能造成的伤害。S1-S4框架由此将医学“首先,不伤害”的原则延伸为:既关注当下,也守护未来。

清华大学黄天荫 医疗人工智能安全风险分类

关注大健康Pai 官方微信:djkpai我们将定期推送医健科技产业最新资讯