人工智能正在迅速重塑医学,通用型大模型与高度专业化的临床系统之间的鸿沟日益扩大。《自然医学》于2026年9月3日在线发表的一项新分析强调了一个关键问题:有限的基准限制了从这两种方法的头对头比较中得出的结论。作者敦促谨慎行事,认为当前的评估框架过于狭窄,无法支持关于哪种AI更有效、更安全或更适合临床的广泛主张。

医疗AI的两大阵营

一方面是通用型AI系统——旨在跨领域处理广泛任务的大型模型。这些模型越来越多地通过微调或提示工程用于医疗,承诺灵活性和成本效益。另一方面是专门为医疗保健构建的临床AI系统:诊断算法、预测风险工具、影像分类器和决策支持系统,这些系统在狭窄但高风险的任務上经过验证。

通用型模型的吸引力在于其泛化能力。一个模型可能潜在地解释放射学图像、总结患者病史、提出鉴别诊断并回答患者问题。然而,医学要求精确性和安全性,这就是为什么专业模型在许多正式监管途径中仍然受到青睐。比较这两种根本不同的范式需要反映真实临床复杂性的基准——而新分析正是在这里发现当前努力的不足。

基准问题

基准是允许研究人员衡量和比较AI性能的标准化测试。在医疗AI中,它们通常采用带有标签的图像、电子健康记录或考试题目的公共数据集形式。但《自然医学》的分析认为,这些基准过于有限,无法支持关于通用型与临床AI的可靠结论。几个因素导致了这种局限性:

  • 范围狭窄:大多数基准侧重于单一任务,例如检测胸部X光片上的肺炎或对皮肤科图像进行分类,这无法捕捉临床工作的多面性。
  • 数据集同质性:公共数据集通常来自少数机构、人口群体或成像设备,限制了任何性能比较的泛化性。
  • 人为条件:基准通常呈现精心策划的、干净的数据,具有明确定义的终点——这与日常实践中遇到的混乱、碎片化和纵向数据形成鲜明对比。
  • 缺少下游结果:一个模型可能在诊断基准上表现出色,但在患者健康结果、工作流程效率或临床医生决策方面却没有提供可衡量的改善。
  • 快速过时:通用型模型频繁更新,静态基准可能很快过时,使比较具有时间敏感性且难以复现。

这些问题不仅仅是学术性的。当使用有限的基准来比较两种根本不同的AI范式时,任何关于优越性或等效性的结论充其量是暂时的。最近分析的文章作者认为,这种限制直接损害了广泛比较的有效性。

为何限制结论

《自然医学》论文的标题——“有限基准限制了通用型与临床AI比较的结论”——概括了一个微妙但有力的论点:基准的选择在很大程度上决定了观察到的结果。通用型模型可能在特定的问答数据集上表现出色,而临床模型可能在专门的诊断任务上表现更好。如果没有一个涵盖多个任务、人群和真实世界环境的全面评估框架,任何声称一种方法绝对更好的说法都是没有根据的。

作者可能指向更广泛的机器学习文献中越来越多的证据,其中基准设计的变化导致了模型排名的剧烈变化。同样的波动性在医疗AI中也很明显。例如,在学术数据集上看似等效的模型,在不同医院的数据或不同疾病患病率的人群上进行测试时,可能会产生显著差异。分析强调,有限的基准不仅遗漏了细微差别;如果过度解读,它们还可能产生误导。

对研究、监管和临床采用的影响

这一批评出现在关键时刻。卫生系统正在谨慎探索在床边使用通用型AI,而FDA等监管机构最近才开始为基于AI的医疗设备制定框架。如果通用型与临床AI的比较基于不充分的证据,临床医生可能被迫基于营销而非科学做出选择。

对于研究人员来说,含义很明确:该领域需要新的、临床基础且多维度的基准。这意味着超越静态图像和文本数据集,转向动态、前瞻性的评估,包括:

  • 跨临床工作流程的多任务评估,如诊断、治疗计划、文档记录和沟通。
  • 反映不同年龄、种族、合并症和医疗环境的不同患者群体。
  • 下游影响的测量,包括临床医生接受度、节省的时间、诊断准确性和患者结果。
  • 对抗性测试,在罕见但关键的条件下探测安全性,例如不寻常的疾病表现或混杂数据。
  • 持续监控协议,以跟踪模型和临床环境随时间演变的性能。

《自然医学》的分析强调,这种真实世界的证据对于验证任何用于医疗的AI至关重要——不是可选的。类似于药物开发中使用的比较有效性研究,可能有必要确定通用型AI是否能在临床上与专业系统并驾齐驱。

走向更稳健的评估文化

改进基准不仅仅是技术努力。它需要临床医生、数据科学家、监管机构和患者之间的合作,以定义在不同临床背景下“好”的样子。一个有希望的方向是创建活基准,不断更新来自多个机构的新案例,提供更真实的性能衡量。另一个是使用联邦学习来跨机构评估模型,而无需集中敏感的健康数据。

同样重要的是评估方法的透明度。研究人员呼吁标准化报告基准特征,包括数据来源、患者人口统计和失败模式分析。这些努力将使AI研究的解释者能够自行评估证据的强度。当前论文通过强调有限基准如何限制即使是善意的比较的结论,为这一目标做出了贡献。

结论

关于通用型与临床AI的讨论才刚刚开始。正如《自然医学》的分析所表明的,科学界必须小心,不要让热情的采用超过严格的验证。基准是必要的工具,但它们不能替代临床证据。研究人员、开发者和临床医生应对任何比较性主张持怀疑态度,直到它得到多样化、现实和临床有意义的评估的支持。

这场辩论的最终赢家将是患者。通过要求更高的AI评估标准,该领域可以确保无论部署什么工具——无论是广泛的通用型模型还是狭窄的临床系统——它们都已在真实医学的复杂、不确定环境中证明了其价值。新论文的信息很简单:当基准有限时,我们的结论也有限。前进的道路取决于扩大证据基础。

本文基于《自然医学》的报道。阅读原文

Originally published on nature.com