常规医院影像或许是医疗 AI 缺失的一环
用于医学影像的人工智能系统往往建立在精心整理的研究数据集之上,但《Nature Medicine》近日重点介绍的一项新研究认为,最大的性能提升可能来自一种远不那么经过筛选的数据:现实医疗系统中每天生成的常规扫描。
据这篇研究简报介绍,研究人员在 524 万例临床计算机断层扫描(CT)和磁共振成像(MRI)序列上训练了一个三维视觉基础模型。该模型并非从公共互联网图像或规模更小的专科数据集中学习,而是直接建立在日常诊疗中使用的神经影像数据流之上。作者报告称,结果不仅实现了最先进的诊断性能,还初步显示该系统可在真实临床环境中支持报告生成和分诊。
这项工作指向医疗 AI 的更广泛转向。多年来,基础模型开发中的主导假设一直是,规模本身就是决定性因素,庞大的公共数据集几乎可以适配任何下游用途。这项研究表明,对于神经影像而言,领域特定的规模与原始数量同样重要。一个接触了数百万真实 CT 和 MRI 检查的模型,似乎能够学习到脑结构和疾病的共享表征,而通用训练数据很难轻易复制这一点。
真实世界数据为何改变了局面
神经影像对传统 AI 流水线来说是一个困难问题。脑部扫描是体数据而非平面图像,不同设备和协议之间存在差异,而临床上重要的发现可能非常细微、弥散,或分布在多个切片上。直接用日常实践中的三维数据训练基础模型,有机会以一种更小规模监督数据集往往无法做到的方式吸收这些模式。
这篇简报称,该模型在 CT 和 MRI 两种模态上学到了神经解剖学与疾病的共享表征。这一点很重要,因为这两种模态捕捉的信息不同,适用的临床场景也不同。CT 常常是急诊和急性神经评估中的核心工具,而 MRI 则更多用于更细致的结构评估。跨这两种格式训练,可能有助于生成一个在不同医疗场景中都更有用的模型,而不是局限于单一任务或单一扫描仪类型。
论文所作的对比尤其值得注意。作者报告称,该模型的诊断性能优于基于公共互联网和医疗数据训练的基础模型。这一比较进一步支持了许多临床医生和信息学研究人员长期私下强调的一点:如果治理和处理得当,高相关性的机构数据可能比从其他领域借来的通用规模更有价值。
在实践中,常规健康系统数据往往很杂乱。它包含采集差异、患者人群差异,以及真实临床流程带来的各种伪影。这些特性通常被视为障碍。在这里,它们或许反而成了优势,因为旨在落地部署的模型最终必须在同样杂乱的环境中运行。
从诊断走向工作流程支持
除了基准性能之外,这项研究还指向医疗系统最关心的两个实际用途:初步报告生成和分诊。两者仍属于敏感应用,但它们说明了这个领域的走向。
初步报告生成并不意味着取代放射科医生,而是指 AI 系统可以帮助概括可能的发现、整理观察结果,或生成一份由临床医生审核和修改的草稿。在高负荷的影像科,即便只是部分辅助,也可能缩短周转时间,并让复杂病例的首次处理更加标准化。
分诊则不同,但同样关键。如果影像 AI 能识别出更可能包含紧急异常的病例,这些检查就可以更快地进入专科复核流程。在卒中、出血、占位效应或其他时效性很强的神经系统疾病中,几分钟都可能很重要。论文将分诊用途描述为可在真实健康系统中实现,这表明模型的评估从一开始就考虑了运营部署,而不仅仅是学术演示。
正是这种组合,既具备强诊断能力,又能辅助工作流程,使这项研究比另一条准确率头条更有意义。影像 AI 之所以常常难以从实验室走向常规使用,是因为模型即便在某个狭窄任务上表现亮眼,也可能无法适配临床运营。能够支持流程中多个环节的系统,更有可能证明其采用所需的成本和集成投入是值得的。
这项研究确立了什么,又没有确立什么
这份研究简报提供的是简洁概述,而不是完整的操作手册,因此仍有若干问题未明。摘录内容没有说明哪些诊断任务带来了最佳结果,也没有说明性能在不同机构之间如何变化,或者模型在边缘案例中的表现如何。它还将报告生成和分诊描述为初步结果,这一限定很重要,因为在该领域,早期演示很容易被夸大。
即便如此,训练集的规模仍然不容忽视。超过 500 万例 CT 和 MRI 序列意味着一种只有大型医疗系统或多机构合作才能现实构建的数据资源。这引出了行业层面的战略问题。如果最强大的医疗基础模型依赖健康系统档案,而不是公开可得的数据集,那么下一轮竞争可能将围绕临床数据获取、治理和信任关系展开,而不仅仅是模型架构本身。
这项研究也强化了一个面向医院评估 AI 供应商的实用教训。性能声明可能在很大程度上取决于模型所学习的数据类型。一个基于诊疗中采集的常规扫描训练的工具,与一个从消费级或研究图像改造而来的工具,其泛化方式可能不同。买方在默认某个“基础模型”彼此可替代之前,可能需要提出更尖锐的问题,涉及来源、代表性和验证。
医疗 AI 走向的一个信号
这篇简报将这项工作与健康 AI 的更广泛运动联系起来:基于健康系统规模的数据构建通用临床模型,而不是将公共网络上的方法原封不动地移植过来。这种路径更难,因为它需要数据基础设施、隐私控制、机构协同以及针对模态的工程设计。但它也可能是产生临床医生真正信任工具的道路。
对于神经影像而言,含义很明确。未来或许不属于那些仅仅见过更多图像的模型,而属于那些从“正确图像”中学习的模型,也就是来自患者日常诊疗现实中的图像。如果这些系统在支持报告和分诊的同时,继续展现最先进的性能,它们就可能不仅在名称上成为基础,更在医院实践中真正成为基础。
本文基于《Nature Medicine》的报道。阅读原文。
Originally published on nature.com
