面向医学最难扫描的通用型AI助手
一次腹部CT扫描将海量临床细节压缩进单一检查中。数十个器官在视野内相互重叠,数百种病变可能隐藏其中。放射科医生普遍认为腹部是医学中最难解读的区域之一,即便是经验丰富的专家也需要时间才能理清所见内容。
为帮助减轻这一工作负担,研究人员推出了一款名为RADAR的新AI助手——即Rapid Abdominal Diagnosis with AI and Radiology(基于AI与放射学的快速腹部诊断)。RADAR并非针对单一器官或单一疾病,而是一个通用型系统,旨在分析腹部CT扫描并帮助医生做出诊断。该研究发表在Science上,DOI为10.1126/science.aec6129,文章经过同行评审、事实核查,并由Science X编辑审阅。
为什么腹部影像对AI来说是个难题
腹部是一个移动的目标,无论从字面还是解剖学意义上都是如此。腹部内的器官在不同患者之间形状和位置差异很大,因此模型无法简单地记住某个结构应该位于何处。异常往往表现为与健康组织之间细微、低对比度的差异,这意味着真正重要的信号可能很微弱。要学会可靠地识别这些差异,放射科医生需要多年经验。
大多数医学AI系统以更狭窄的任务范围来处理影像。它们通常为特定任务而构建,并通过监督学习进行训练,这一过程需要医学专家先手动标注数据。标注步骤缓慢、昂贵且难以扩展——这限制了单一模型能够应用的广度。
直接从放射学报告中学习
RADAR走了一条不同的路。它建立在一个可扩展的视觉-语言框架之上,直接使用临床报告进行训练,无需专家事先手动标记或标注数据。实际上,该系统学习的是图像中所呈现的内容与放射科医生用于描述它的语言之间的关系。

这一训练的规模值得关注:
- 覆盖424,911例检查的临床报告
- 150万对图像-文本配对
- 超过1500万对解剖结构特异性配对
由于该模型利用的是放射科医生在日常诊疗中已经生成的自由文本,这一流程绕开了医学AI开发中最大的瓶颈之一。研究人员将该框架描述为可扩展的,表明它能够吸收大量真实临床材料,而不是依赖为某一项研究手工整理的数据集。
在八家医院开展的真实世界测试
所报告的性能来自对真实世界医院检查的测试,而非经过整理的研究图像。RADAR取得了0.913的平均诊断准确率评分(以AUC衡量)——这一结果优于现有的医学视觉-语言AI模型。
与这一标志性数字同样重要的是它在哪些场景下依然成立。结果在八家不同医院中超越了原始环境并得到泛化,在急诊科病例中依然成立,并在多样化患者群体中保持稳定。对医学AI而言,这种一致性很重要,因为一个只在与其训练环境相似的数据上表现良好的模型,其临床价值有限。
根据Science上的研究结果,无论在哪里或以何种方式测试,RADAR都能准确识别18个解剖结构以及146种影像征象和疾病。

覆盖广度包含哪些内容
解剖结构与影像征象的结合表明,该系统解读扫描的方式更像一位普通放射科医生,而非单一用途的检测器。该模型不是只回答关于某个器官的一个问题,而是定位于解读腹部的整体图景。
RADAR可能为放射科医生带来哪些改变
该项目背后的既定动机是工作负担。腹部CT要求很高,仔细解读需要时间,而放射科并不总是拥有这些时间。一个能够生成广泛诊断解读的通用型助手,可以为临床医生处理复杂检查时提供一个起点。
研究人员将RADAR定位为帮助医生做出诊断的助手,而非替代其判断。这一区分贯穿当前医学AI的许多工作,其实际目标往往是分类、排序和总结,而不是给出最终结论。
此案例中引人注目的是范围与稳健性的结合。一个在近425,000例检查上训练、并在八家医院中得到验证的单一框架,代表着对主导该领域的狭窄、任务专用工具的一次有意义超越。
关键数字一览
- 系统:RADAR(Rapid Abdominal Diagnosis with AI and Radiology)
- 训练数据:424,911例检查;150万对图像-文本配对;超过1500万对解剖结构特异性配对
- 平均诊断准确率(AUC):0.913
- 识别内容:18个解剖结构以及146种影像征象和疾病
- 验证:八家医院、急诊科病例及多样化患者群体
- 发表:Science(DOI: 10.1126/science.aec6129)
随着腹部影像检查量持续增长,帮助放射科医生应对医学中最复杂扫描之一的工具将受到密切关注。RADAR所报告的结果为研究人员提供了一个清晰的基准——也为直接在临床医生每天撰写的报告上训练通用型医学AI提供了一个模板。
本文基于Medical Xpress的报道。阅读原文。
Originally published on medicalxpress.com






