诊断人工智能的重要发表

《科学》杂志发表了一项研究,描述了一个专为腹部CT诊断设计的专家级通用人工智能系统。该成果发表于2026年9月的第393卷第6817期,跻身于跨学科同行评审研究最广泛阅读的发表平台之一。该记录可通过期刊的数字对象标识符访问,但全文处于受限访问状态,仅摘要级条目可公开获取。

仅从标题来看,这篇论文就传递出一个雄心勃勃的主张。它描述的既不是用于发现单一异常的工具,也不是局限于某一器官或某一疾病的模型。相反,它呈现的是一个定位于腹部专家级诊断性能的通用系统——而腹部是一个解剖结构密集、疾病表现方式以多变著称的区域。

为何“通用”一词至关重要

在过去十年的大部分时间里,医学影像人工智能一直通过专业化路径推进。研究人员通常将模型训练在严格限定的任务上:在特定类型的扫描中、特定器官上标记某一特定发现,且往往局限于单一机构的数据。这些狭窄的工具可以表现出色,但每一个都只解决一个必须由人类预先定义的问题。

通用模型则意味着结构上的不同。它不是围绕单一问题构建,而是被期望同时处理多个问题。这些区别值得详细说明:

  • 任务范围:狭窄模型回答一个查询;通用模型则被期望在同一次交互中处理广泛的诊断问题。
  • 解剖覆盖:专科工具通常聚焦于单一器官,而通用模型必须应对整个腹腔及其邻近结构。
  • 输入的灵活性:通用系统旨在接受多样化的临床提示,而非固定的、预先设计的输入。
  • 学习迁移:通用模型的承诺在于,在一类问题上获得的能力可以迁移到其他问题,而无需从头重新训练。

这一框架也呼应了机器学习领域的一个更广泛趋势,即通用系统日益取代任务专用流程。这一趋势能否顺利转化为临床医学,正是这篇论文似乎要探讨的问题。

腹部CT作为压力测试

选择腹部作为验证场并非偶然。腹部CT是现代医院中检查量最大的影像学检查之一,广泛应用于急诊科、肿瘤科、手术规划和常规随访。它也是构建可靠自动化阅片系统最困难的场景之一。

  • 该区域包含大量紧密相邻的器官和组织类型,彼此之间边界细微。
  • 发现范围从显而易见者到几乎不可见者,而临床重要性并不总是与视觉显著性一致。
  • 偶然发现十分常见,这意味着一个有用的系统必须区分紧急病变与良性异常。
  • 扫描质量、对比剂方案和患者解剖结构在不同机构之间差异巨大。

因此,针对这一领域的专家级通用系统将代表一次有意义的能力跃升,而非渐进式提升。它也会提高验证的门槛,因为一个声称具备广泛能力的系统必须在广泛条件下接受测试。

对放射学实践可能意味着什么

如果此类系统趋于成熟,其实际影响很可能体现在工作流程中,而非取代临床医生。

分诊与优先级排序

通用阅片系统可以审查 incoming 扫描,并筛选出最可能需要紧急人工关注的病例,帮助科室在需求超过人员配置时管理排队。这是最有可能的近期应用之一,因为它改变的是排序,而非最终判读。

二次阅片支持

在繁重病例负荷下的放射科医生,能从对疑难检查的冗余核查中获益。一个能够对广泛发现发表意见、而非仅检测其被训练识别的那一项的系统,可能比狭窄的检测器充当更有用的安全网。

资源不足环境中的可及性

在专科放射学覆盖薄弱的地区,通用能力尤其具有吸引力。一个处理多种诊断问题的单一模型,比一组各自需要验证和维护的独立工具更易于部署。

该领域将提出的开放性问题

在如此级别的期刊上发表,表明该成果已通过同行评审,但这并不能解决临床采用中最重要的问题。可能影响讨论的议题包括:

  • 外部验证:在那些数据未参与开发的机构之外,性能保持得如何?
  • 错误特征:系统会漏掉什么,这些漏诊是否集中在临床危险的类别中?
  • 可解释性:临床医生能否质询结论的依据,还是必须将其视为黑箱接受?
  • 监管路径:通用主张在围绕狭窄定义适应症构建的框架中显得格格不入。
  • 责任与问责:在软件参与判读的任何地方,漏诊的责任归属仍是一个悬而未决的问题。
  • 数据来源:训练数据的构成决定了系统最了解谁的解剖结构。

这些与其说是怀疑的理由,不如说是任何诊断技术在规模化惠及患者之前必须满足的标准条件。

更大的图景

这篇论文的意义超越了单一临床应用。如果专家级通用性能在腹部影像这样高要求的领域得到证明,那就表明通用方法在医学中整体上是可行的——这一主张直到最近更多依赖外推而非证据。这将改变整个领域的资源和预期,从定制的单任务工具转向可被调整而非重建的更广泛系统。

它也重新定义了研究人员对评估的思考方式。对通用系统进行基准测试意味着测试广度,而不仅仅是在精心策划任务上的峰值准确率,而服务于狭窄模型的指标可能被证明是不够的。

接下来值得关注什么

自然的后续包括独立复现、在真实临床环境中开展的前瞻性研究,以及此类系统将如何获得监管批准的明确说明。每一步都需要数年时间,而每一步都是前景可期的影像人工智能历史上要么证明自身、要么停滞不前的地方。就目前而言,这篇论文是一个值得注意的标志:一家顶级期刊将其版面借给这样一个命题——单一人工智能系统能够以专家水平对腹部进行推理。

本文基于 Science (AAAS) 的报道。阅读原文

Originally published on science.org