关于临床AI如何赢得信任的直言警告

人工智能进入医学领域有一个熟悉的模式:一个模型在精心策划的测试集上取得亮眼数字,媒体争相报道,采用压力在任何人能够确信该系统在真实诊所、真实患者、真实风险下如何表现之前就已积累。2026年9月14日在线发表于《自然·医学》的一篇新评论文章直接针对这一模式。其核心主张毫不含糊:临床人工智能的信任无法通过基准测试凭空建立。它必须通过严谨性来赢得。

对于一个已经习惯于将排行榜结果视为就绪度代理指标的行业来说,这一框架刻意令人不适。文章标题明确表达了这种张力——对话式医疗AI的前瞻性证据很难获得,但不可妥协。这句话的两半都很重要。困难是真实的,不应被轻描淡写。但困难不是用更简单、更无意义的东西来替代的理由。

为什么基准测试不等同于证据

该评论文章所区分的,是静态评估上的表现与前瞻性收集的证据之间的差异——也就是说,证据是通过观察系统在实际使用中、在它本应工作的环境中发生的情况而产生的,而非在回顾性或模拟的测试框架中产生的。

对于对话式医疗AI而言,这两者之间的差距异常之大。对话式系统不仅仅是分类一张图像或标记一个实验室数值。它参与一场交流。它提问、回答、澄清、安抚,偶尔也会拒绝。它的输出取决于用户说了什么、如何说、提供了什么背景信息,以及遗漏了什么。无论测试集构建得多么精心,这些都无法被固定测试集完全捕捉。

该评论文章的观点并不是说基准测试毫无用处。而是说,基准分数是在受控条件下对模型的测量,而受控条件恰恰不是临床诊疗的样子。当文章说信任无法通过基准测试凭空建立时,它指向的是一种范畴错误:把一个数字当作一种保证。

是什么让前瞻性证据如此难以产出

该评论文章坦率地指出,严谨的路径是昂贵的路径。有几个因素使对话式医疗AI的前瞻性评估真正变得困难:

  • 对话是开放式的。与固定输入和固定预期输出不同,对话可以朝许多方向发展。定义什么算作良好结果需要临床和伦理层面的决策,而不仅仅是技术层面的决策。
  • 背景就是一切。对某一人群、诊疗环境或工作流程合适的回应,在另一种情境中可能并不合适。在一种情境中收集的证据不会自动迁移。
  • 真实世界部署引入了变量。人类用户会适应系统、绕过系统,或过度信任系统。这些行为塑造了结果,而在部署前测试中基本上是不可见的。
  • 时间和成本。前瞻性工作比运行评估脚本耗时更长、成本更高。这种不对称造成了持续跳过它的压力。
  • 移动的目标。系统会更新,提示词会修改,模型会替换。与某一版本绑定的证据可能对下一版本说明不了什么。

这些都是合理的障碍。该评论文章的观点是,它们是待解决的障碍,而不是可以接受的借口。

论证中不可妥协的那一半

如果文章框架的前一半承认了困难,那么后一半则移除了逃生通道。前瞻性证据被描述为不可妥协的——不是理想化的,不是最佳实践,不是以后再说的事。其推理源于利害攸关之处。

对话式医疗AI紧邻临床决策点,并且越来越接近患者。它可能被定位为分诊辅助工具、文档助手、面向患者的信息来源,或介于其间的东西。在每一种角色中,出错的后果都由人来承担,而不是由验证脚本来承担。当失败模式是漏诊、转诊延迟,或自信陈述但错误的答案时,证明标准应由后果来设定,而不是由开发者的便利来设定。

该评论文章将此直接与信任联系起来。在其框架中,信任不是一个沟通问题,更好的营销或更强的排行榜位置无法解决。它是在与重要情境相似的条件下展示出的表现所产生的结果。严谨是唯一途径,而捷径会在结果中显露出来。

严谨究竟要求什么

该评论文章没有提供简单化的清单,但其逻辑隐含了对任何将对话式系统推向临床使用的人的一系列期望:

  • 在系统将要运行的地方进行评估。证据应来自该工具预期运作的环境、人群和工作流程。
  • 在测量之前定义结果。具有临床意义的终点——而非代理指标——应锚定评估。
  • 报告你所发现的,包括失败。选择性报告会破坏证据本应建立的信任。
  • 将证据视为有版本的。如果系统发生变化,证据应被重新审查,而不是被祖父条款式地沿用。
  • 接受有些问题需要数年时间。没有快速答案并不等于没有义务。

综合来看,这些期望指向一种更缓慢、更有纪律的开发文化——在这种文化中,发布模型的能力与依赖它的权利被分离开来。

这对临床医生意味着什么

对于执业临床医生而言,该评论文章传达的信息是:要警惕让界面精美替代验证。一个听起来流利、自信且体贴的对话式系统,可能营造出一种其底层证据未必支持的能力感。文章的观点意味着,临床医生应该询问存在哪些前瞻性证据、针对哪一人群、以及针对该工具的哪个版本——并且应该坦然地将缺乏答案视为等待的理由。

这对开发者和监管者意味着什么

对于构建者而言,信息是:前瞻性评估是在临床环境中开展业务的成本,而不是可选的最后一步。对于监管者和卫生系统而言,其含义是:评估框架需要容纳行为由交互塑造的系统,并且批准或采用决策应锚定于来自预期使用环境的证据。

令人不适但正确的结论

《自然·医学》的这篇评论文章落脚于一个原则上容易认同、实践中难以践行的立场。它承认对话式医疗AI的前瞻性证据困难、缓慢且昂贵。然后它论证说,这些事实都不能改变这一要求。临床AI的信任无法通过基准测试凭空建立;它必须通过严谨性来赢得。

这是一个苛刻的标准。它也是唯一与这项技术——以及将遇到它的患者——所被要求的东西相匹配的标准。

本文基于《自然·医学》的报道。阅读原文

Originally published on nature.com