
出品 | 搜狐健康
作者 | 吳施楠
編輯 | 袁月
如今,人工智能(AI)正在深度重構醫療行業的診療模式,從影像篩查、輔助診斷到臨床決策、慢病管理,醫學AI已走出實驗室試點階段,全面邁入真實臨床場景落地應用。然而,准確性越來越高並不意味著安全。一旦AI造成漏診、延誤或過度治療,後果可能要到數月或數年後才會顯現。因此,一個適配的安全性評價標准,對於醫學AI的落地應用非常關鍵。
8月17日,上海交通大學盛斌,清華大學黃天蔭、宋佳穎、吳嘉敏,斯坦福大學Nigam Shah,倫敦國王學院Josip Car在NEJM AI發表觀點文章,提出醫學AI的S1—S4四級安全分類框架。作者強調,醫學AI不僅要證明當下的性能,還要通過長期監測發現未來風險,將醫學“首先,不傷害”的核心承諾強化為“首先,不傷害——無論現在還是未來”。
醫學AI風險滯後性強
研究團隊在研究中指出,醫學AI的風險具有滯後性、隱匿性和不可逆性,這也是傳統安全評價體系的核心不足。
不同於普通互聯網AI、消費級AI的即時性風險,醫學AI引發的診療傷害往往存在漫長的潛伏期。部分由AI算法偏差、數據偏見、場景適配缺陷導致的診療問題,不會在單次診斷、乾預後立刻顯現,可能在數月甚至數年後,才以病情延誤、過度診療、慢性病進展、並發症加重等形式暴露。
更棘手的是,這類遠期傷害鏈條冗長、影響因素繁雜,事後很難精准追溯至最初的AI決策輸出,最終造成嚴重甚至不可逆的患者健康損害,而風險源頭卻被模糊、忽略。這意味著,暫時未觀察到傷害,並不足以證明醫學AI系統的長期安全性。
基於這一核心認知,研究團隊跳出傳統“結果導向”的安全評價思維,構建起一套過程化、全周期、分級管控的S1-S4醫學AI安全風險分級框架,重構醫療AI安全的評判邏輯。
展開全文
具體來看,S1指範圍狹窄且可測試的應用;S2指臨床醫師在采取行動前須審核的決策支持;S3指重要傷害可能僅在隨訪後才顯現,因而在廣泛推廣前須進行監測和結局監測的應用;S4指應予禁止或僅在采取特殊保障措施下才允許的高風險自主行動。
需要注意的是,S等級不是AI模型本身的固定屬性,而是具體部署方式的安全標簽。等級取決於AI承擔的臨床任務、所嵌入的工作流程、服務的患者群體、能否持續跟蹤患者的後續情況,以及醫生能否在采取行動前進行有效複核與乾預。
因此,框架不再單一關注AI模型的靜態准確率,而是聚焦醫學AI落地臨床的核心核心命題:當AI系統在新患者群體、新診療場景、新工作流程中出現意外偏差與異常行為時,醫療機構能否快速感知、精准溯源、及時乾預、止損風險。

來源 / NEJM醫學前沿
重塑醫學AI安全評價標准
過去行業評價AI安全,核心看“模型准不准、當下有沒有問題”;而研究團隊提出的新標准,核心看“系統穩不穩、風險能不能控、隱患能不能查”。其本質是將醫學AI的安全治理,從“靜態結果驗收”升級為“全流程動態風控”,從“事後追責補救”前置為“事前分級預判、事中動態監測、事後精准溯源”的全周期治理模式。
在醫學AI加速落地的當下,研究團隊牽頭構建的四級風險框架,補齊了缺乏統一的風險評判與管控依據這一行業短板,具備極強的行業價值與現實意義。
文章強調,S1-S4框架旨在補充而非替代歐盟《人工智能法案》、國際醫療器械監管機構論壇的軟件醫療器械框架,以及美國食品藥品監督管理局、美國國家標准與技術研究院和世界衛生組織的相關指南。其主要價值在於,將傷害何時顯現、醫生何時必須複核、何時需要鏈接隨訪結局,以及誰有權暫停或回滾系統,納入同一套臨床治理邏輯。
它為研發機構提供了標准化的模型優化方向,推動醫學AI研發從“追求高准確率”的單一目標,轉向“准確率、安全性、穩定性、可溯源性”多維均衡發展,倒逼算法研發兼顧通用性能與場景適配安全。此外,它為醫療機構的AI落地應用提供了清晰的准入、運維、風控標准,助力醫院建立分級分類的AI使用管理制度,針對不同風險等級的AI應用,匹配差異化的人工複核、動態監測、風險預警機制。
研究團隊最後指出,醫療AI不僅應以目前的表現或安全性來判斷,還應看醫療系統能否發現、追溯並減輕它未來可能造成的傷害。S1-S4框架由此將醫學“首先,不傷害”的原則延伸為:既關注當下,也守護未來。
參考資料:
1、NEJM AI:清華、上交大團隊提出醫學AI安全分級,強化“不傷害”原則
https://mp.weixin.qq.com/s/0n15XoIyIhFBXzzAeXSP_Q
2、黃天蔭團隊提出醫療人工智能安全風險分級框架
https://mp.weixin.qq.com/s/rJ4njKbnjR84ChrbstSFuQ返回搜狐,查看更多
共 0 則評論,您可以發表一個妙評