临床环境中AI基准测试的争论
《自然医学》新发表的一篇回复直击医学中人工智能系统比较的核心问题。该回复回应了一项批评,该批评声称“有限的基准限制了通用型与临床AI比较的结论”。随着广泛使用的对话模型和窄范围训练的临床AI的增长,这一争议表明迫切需要更稳健的评估框架。
科学通信是完善证据的标准机制,而这一特定的交流之所以重要,是因为它涉及一个将影响数百万患者的问题:当通用型AI助手和专门的临床AI模型都声称支持临床医生时,医院应该部署哪一种?回复的作者为其原始分析辩护,同时承认基准选择不可避免地会影响结果。
通用型AI与临床AI:比较的是什么?
通用型AI系统,包括在互联网规模语料库上训练的大型语言模型,承诺为各种医学查询提供灵活支持。它们可以总结患者病史、起草出院信或流畅地回答医学考试问题。另一方面,临床AI模型使用医学数据进行开发和验证,通常具有针对特定任务的监管许可,例如检测糖尿病视网膜病变、解读胸部X光片或指导脓毒症治疗。
比较研究旨在确定使用一个多用途模型的便利性是否超过任务特定系统可能具有的更高准确性。原始研究试图通过选择一组面向用户的任务并在相同输入上对两种模型进行基准测试来回答这个问题。
为什么基准被称为“有限”
根据引发新回复的评论,原始研究的基准来自少量医学数据集,可能无法代表真实世界临床遭遇的广度。评论的作者担心,少数几个频繁使用的测试可能会掩盖模型在其他医学专科中的局限性,或者无意中奖励一个在一个数据集上表现良好但在其他数据集上失败的模型。
基准局限性之所以重要,有几个原因。首先,模型在数据集上的表现并不等同于其在诊所中的表现。人为因素、数据分布变化、噪声以及病例组合都会改变情况。其次,许多公共基准已经饱和——现代模型可以轻松超越它们,几乎没有空间区分最好的和仅仅合格的。第三,稀疏的基准测试可能导致对通用型模型的过度自信,而这些模型在临床意义上并非真正的“通用智能”。
回复的论点
在他们发表的回复中,研究人员坚持认为,对模型类别进行仔细比较仍然可以提供信息。他们指出,尽管没有哪个基准套件是全面的,但适当选择的一组任务可以揭示有意义的差异和权衡。例如,一个显示临床模型在三个狭窄任务上占主导地位的基准,并不能告诉我们开放式问题会发生什么,就像通用型模型在琐事测试中获胜并不能证明它已准备好进入急诊室一样。
回复确认,目标不是选出总体赢家,而是描绘每种方法的优缺点。当通用型模型在需要领域特定知识的任务中表现不佳时,这对开发者来说是一个有用的信号。当临床模型无法回答更一般的问题时,这对未来的训练优先级也是有价值的。
超越基准之争
这一交流的更深层共鸣在于更广泛的科学努力,即验证AI在健康领域的应用。人们越来越认识到,没有任何单一结果,无论多么具有统计显著性,都能证明模型在所有情况下都是安全可靠的。证据必须是累积的。比较需要多层评估,包括准确性、公平性、可解释性、对分布变化的鲁棒性以及对临床工作流程和结果的影响。
作者的回应通过强调“临床AI与通用AI”的框架不应被视为非此即彼的权衡,推动了社区向前发展。系统开发可以看作一个连续体,通才和专才模型可以合作:大型语言模型处理对话细微差别,而专门的深度视觉模型逐像素读取影像。
对医疗决策者的影响
阅读原始论文和后续通信的医疗机构可能想知道该采取什么行动。教训是采用证据优先的心态。在将任何模型纳入临床路径之前,检查确切的基准任务、患者人口统计、标签质量以及外部验证的程度至关重要。
监管机构开始密切关注这些类型的比较。美国食品药品监督管理局越来越接受软件学习的“预定变更控制计划”概念,但仍缺乏一套标准的跨供应商医疗AI基准。在欧洲,医疗器械法规要求对可能构成健康风险的软件进行强有力的临床评估。一个清晰、共享的AI基准框架将有助于所有利益相关者。
如何构建更好的基准
那么,更好的基准会是什么样子?首先,它应该包括来自多家医院、不同地理区域和社会经济背景的案例,以反映患者护理的多样性。其次,它应该分别测试核心知识、医学推理、安全性以及请求澄清的能力。第三,它应该随着AI能力和临床实践的发展而不断更新。
在理想情况下,基准任务应该是动态和对抗性的,这意味着研究人员专门尝试寻找模型的弱点。这将防止模型过度拟合静态测试集,这是标准化基准公开多年后不可避免的问题。然而,构建和维护这样的基准需要资金以及AI开发者、临床学会和卫生当局之间的合作——这一目标似乎仍然遥远。
已发表通信的科学价值
最近在《自然医学》上的来回交流也提醒我们,科学通过批评、回应和修正而进步。发表原始发现并不是旅程的终点;它是向科学界审查的开放。读者参与基准局限性讨论的事实表明了对最高水平证据的需求。
在这个具体案例中,回复并非旨在结束对话。相反,它澄清了初始比较期间所做的选择,并邀请进一步的工作以产生更可推广的结论。这种公开交流加强了这两项研究的合法性,并支持知情的临床决策。
下一步是什么
对于通用型和临床AI的开发者来说,教训是透明的报告和稳健的评估将区分值得信赖的工具和实验原型。对于研究人员来说,通信指向了一个丰富的问题议程:在特定学科中,哪些基准应具有权威性?如何在不同语言和卫生系统之间协调基准?如何在基准设计中纳入潜在偏见?
回复的作者正确地指出,有限的基准并不是自动取消任何结论的资格。但他们的交流也证明了为什么基准局限性应在每篇出版物中明确承认。随着AI在医学中的应用扩大,我们将需要更多这样的交流——彻底、诚实,并以患者安全的共同目标为指导。
本文基于《自然医学》的报道。阅读原文。
Originally published on nature.com



