医学人工智能的新标准

多年来,医学人工智能(AI)领域一直围绕一个单一问题展开:算法能否与临床专家的表现相媲美?数十项研究将深度学习模型与放射科医生、病理学家和皮肤科医生进行了比较,通常在回顾性数据集上取得了令人印象深刻的结果。但《自然医学》杂志最近的一篇评论认为,第一代医学AI设定了错误的基准。它认为,下一代AI的评判标准不应是机器能否复制人类专业知识,而是精心设计的人机系统能否改善患者结局。

该评论由隆德大学诊断放射学系的Kristina Lång博士撰写,借鉴了医学领域首批AI随机试验之一的经验教训,主张我们对临床AI的评估和实施方式进行深刻转变。这是一个呼吁,要求超越准确性指标,转向真正重要的衡量标准:发病率、死亡率、生活质量以及护理服务的效率和公平性。

第一代:模仿临床医生的算法

早期医学AI研究主要受一种观点主导,即模型的价值可以通过将其输出与人类专家的输出直接比较来确定。研究报告了敏感性、特异性和受试者工作特征曲线下面积,通常得出结论认为AI系统与临床医生“相当”或“更优”。这些发现引发了巨大的热情,并促使数百种AI工具在放射学、心脏病学和其他专业领域获得监管许可。

然而,算法等效并不等同于临床获益。一个在解读图像方面与放射科医生相当的模型,一旦整合到繁忙的医院工作流程中,可能仍无法改善整体诊断过程。它可能产生被忽略的警报、增加工作量或在患者管理中引入新的错误。回顾性研究的受控环境无法捕捉这些现实世界的复杂性。正如Lång所写,第一代AI的评判标准是能否与临床医生匹敌;下一代则应评判它能否帮助患者。

AI随机试验的兴起

随机对照试验(RCT)是评估医疗干预的金标准。它们消除了混杂因素,考虑了人类行为,并提供了改变临床实践所需的证据水平。然而,在AI领域,RCT一直很少见。大多数AI工具的证据来自回顾性或前瞻性单臂研究,外部有效性有限。这种情况正在改变,Lång强调了RCT的出现是一个关键发展。

最显著的例子之一是MASAI试验,这是在瑞典进行的一项随机研究,调查了AI辅助乳腺X线摄影筛查的使用。该试验于2023年发表在《柳叶刀肿瘤学》上,是最早将患者随机分配接受AI辅助筛查或标准双读的试验之一。该试验不仅衡量了算法的癌症检出率,还衡量了筛查检出癌症、间期癌、召回率和工作量等结局。结果表明,AI可以减轻放射科医生的工作量,同时保持或可能提高癌症检出率,但真正的教训更为广泛:只有随机设计才能提供关于整个人机系统的可信答案。

Lång的评论引用了其他最近的RCT,包括2025年发表在《柳叶刀数字健康》上的一项研究和2026年发表在《柳叶刀》上的一项研究,作为新兴证据基础的一部分。这些试验代表了新一波研究浪潮,将AI视为嵌入临床路径的干预措施,并以患者为导向的终点进行评估,而不是将其视为独立技术。

来自前线的教训

Lång既是放射科医生,也是AI筛查试验的首席研究员,她指出了超越统计显著性的关键教训。首先,患者结局至关重要。仅仅证明AI系统可以更快或更准确地分类图像是不够的;必须证明它能改善患者的旅程,从早期发现到治疗和生存。

其次,人机交互的设计至关重要。算法的好坏取决于其周围的系统。警报的呈现方式、临床医生如何接受培训以做出反应以及责任如何分配都会影响最终结果。Lång强调“精心设计的人机系统”,这表明焦点从模型本身转移到其运行的社会技术环境。

第三,实施科学很重要。成功的试验并不能保证成功部署。将AI整合到现有临床工作流程、确保报销以及维持临床医生和患者信任的挑战与任何算法进步一样重要。Lång担任瑞典国家乳腺癌症筛查指南主席,并曾为西门子医疗等公司的顾问委员会服务,她亲身了解这些转化障碍。

重新思考新时代的评估

该评论认为,医学AI的评估必须采用与药物和设备相同的严格标准。这意味着需要更多的RCT,也需要使用适当的对照、具有临床意义的终点以及反映日常实践的务实试验设计。监管机构和专业学会开始要求这样的证据,但技术创新速度与评估速度之间的差距仍然很大。

Lång建议,该领域应不再问“AI是否比临床医生更好?”,而应问“这个AI-临床医生团队能否改善结局、减少伤害并明智地使用资源?”这种重新框定对研究设计、资金优先事项和出版标准具有深远影响。它还使开发者承担更大的责任,要求他们构建透明、可解释且符合临床需求的工具。

构建更好的人机系统

评论中最引人注目的呼吁之一是与一线临床医生共同设计AI系统。如果目标是改善患者结局,那么用户界面、决策支持逻辑和反馈机制必须由临床实践的现实来塑造。这在癌症筛查等高风险领域尤为重要,在这些领域,AI被用于分诊病例、标记可疑发现,并可能减少放射科医生需要审查的图像数量。

Lång自己的研究探索了人类感知和专业知识如何与机器诊断相互作用。早期工作,包括发表在《欧洲放射学》和《放射学》上的论文,研究了“搜索满足”效应以及放射科医生在其他异常存在时如何漏诊。这些认知心理学见解现在被应用于理解放射科医生对AI的信任如何影响他们的决策。一个准确但校准不良的系统可能导致过度自信或利用不足,这两者都可能伤害患者。

未来之路:证据、伦理与公平

随着AI在医学中越来越普遍,对可靠证据的需求变得紧迫。Lång的评论提醒我们,RCT不仅仅是一种形式;它们对于理解哪些AI应用提供真正的价值以及哪些可能引入新形式的偏见或伤害至关重要。这对于在用于训练AI模型的数据集中可能代表性不足的服务不足人群尤其相关。

作者还指出,医学AI的发展与商业激励交织在一起。作为N23 Health的联合创始人和大公司的顾问,她并不反对行业,而是倡导基于证据的创新。目标应该是将市场激励与严格评估相结合,以便到达患者手中的工具已被证明能帮助他们。

结论:临床AI的新基准

《自然医学》上的评论传递了一个及时的信息。简单地将算法与临床医生进行比较的时代已经结束。现在重要的是,当AI整合到精心设计的临床系统中时,能否切实改善患者的生活。随机试验,如Lång帮助领导的试验,是技术承诺与现实获益之间的桥梁。它们提供了必要的证据,以确保下一代医学AI达到最高标准:改善患者结局。

随着该领域的成熟,研究人员、监管机构、临床医生和开发者必须共同努力,使随机评估成为常态而非例外。只有这样,医学AI才能实现其作为更健康生活力量的全部潜力。教训是明确的,它们始于一个简单的转变:判断成功不是看算法做了什么,而是看患者体验到了什么。

本文基于《自然医学》的报道。阅读原文

Originally published on nature.com