一种用于肝脏 CT 扫描的 AI 读片器,从回顾性测试走向常规临床实践
8 月 19 日发表于 Nature Medicine 的一项大型研究,描述了一种旨在辅助增强计算机断层扫描(CE-CT)肝脏恶性肿瘤诊断的人工智能系统。该系统名为 Liver DiagnOsis Network,简称 LiON,设计目标是贴合临床影像工作的现实:扫描数量巨大、扫描期相可能不同、患者背景很重要,而延误或漏诊都可能带来严重后果。
论文直接点出了这一问题。肝脏恶性肿瘤通常通过 CE-CT 评估,但真实世界的放射科工作流程仍然可能遗漏病灶或延迟诊断。LiON 被开发为一种可扩展的“诊断安全网”,能够处理灵活的多期成像、整合临床数据,并在现有流程中运行,而不是取代这些流程。
这种实用导向很重要。许多医疗 AI 项目在回顾性指标上表现强劲,但在进入日常诊疗后却难以证明价值。这项研究的突出之处在于,它把大规模开发与验证,和在常规临床实践中的单臂试验结合起来,从而更具体地呈现出该软件在放射科医生按正常方式为普通患者工作时的表现。
大型数据集与强劲的诊断表现
根据摘要,LiON 使用来自 6,443 名患者的数据进行训练,并在来自多中心和真实世界队列的 22,251 名患者中进行了回顾性验证。在这些回顾性评估中,模型在恶性肿瘤诊断上的受试者工作特征曲线下面积(AUC)达到 0.975,95% 置信区间为 0.971 至 0.979。
研究还显示,该模型在具有重要临床意义的亚组中仍保持强劲表现。在脂肪肝患者中,LiON 的 AUC 达到 0.971。在肝硬化患者中,这一群体更难判断且风险更高,影像解读尤其具有挑战性,AUC 为 0.924。这些结果表明,该模型并不依赖于狭窄、理想化的患者样本,并且在常常使肝脏影像变得复杂的条件下仍具实用性。
这也是这篇论文可能引起关注的原因之一。在肝脏肿瘤学和肝病学领域,只在干净数据集上表现良好的模型,其临床价值有限。能够在异质队列和合并肝病中仍然有效的模型,才更接近医疗系统可实际部署的工具。
关键测试是常规使用,而不只是回顾性基准比较
论文更有力的信号来自前瞻式部署研究。研究人员开展了一项涉及 10,333 名患者的单臂试验,在常规临床实践中让 LiON 作为现有工作流程中的额外 AI 读片者使用。研究并不是问 AI 能否在孤立对决中战胜人类,而是考察当放射科医生照常工作时,系统是否还能增加价值。
试验达到了主要终点。该终点要求恶性肿瘤诊断 AUC 的 95% 置信区间下限超过 0.900。LiON 实现的 AUC 为 0.952,95% 置信区间为 0.942 至 0.961。
这些数字之所以重要,是因为它们说明该模型在操作环境下依然站得住脚,而不只是经由精心整理的回顾性评审。换句话说,在被置入更混杂的常规医院影像环境之后,该系统似乎仍保留了很高的诊断区分能力。
AI 具体改变了哪些诊疗环节
对临床医生和医院管理者来说,次要终点或许是报告中最重要的部分。研究称,AI 与人类协作识别出了 51 个此前被忽略的病灶,其中包括 15 个恶性病灶。它还触发了 37 份放射科报告修订,以及 22 次多学科团队升级讨论。
这些并不是抽象的性能指标。它们指向了医疗系统真正关心的下游影响:原本可能被遗漏的发现、经 AI 审阅后被修改的报告,以及被提交给更广泛临床讨论的病例。即使没有供稿文本中的完整结局数据,这些工作流程层面的结果也说明,该模型更像是一个安全兜底,而不只是一个打分引擎。
这种区别对医疗 AI 采用进入当前阶段至关重要。最有前景的系统越来越不是被当作自主诊断者来推销,而是作为第二读片者,帮助发现疏漏、标准化审查,并降低忙碌团队错过细微但关键发现的风险。
这项研究为何可能超越肝脏影像领域
LiON 的设计也反映出临床 AI 开发中的一个更广泛转向。论文强调了灵活的多期处理、临床数据整合以及与工作流程的兼容性。这些特性共同回应了影像 AI 的三个常见失败点:对僵化扫描协议的依赖、对患者上下文利用不足,以及与放射科医生工作流程不匹配。
如果这些说法在摘要之外也成立,LiON 可能会成为评估影像 AI 系统的一个参考点。该领域越来越要求多中心验证、真实世界队列以及现场临床部署的证据,而不是只依赖单一回顾性基准。这项研究以相当大的规模逐项满足了这些要求。
它也出现在医院承受压力、需要用现有人员和基础设施做更多事情的时点。一个能够适应可变影像输入并提供第二层审查的 AI 系统,可能会吸引那些希望在不从根本上重构放射科运营的情况下提升质量的医疗中心。
仍需保持谨慎
所给来源文本并未提供判断其普适性、实施成本或对长期患者结局影响所需的全部细节。例如,这里没有说明假阳性如何影响工作负担、不同机构之间表现如何变化,或者更早发现是否转化为可衡量的治疗收益。这些问题将决定一项强势研究能否转化为广泛的临床采用。
尽管如此,摘要中概括的证据对于医疗 AI 论文来说仍然异常扎实:数千例训练样本、超过 22,000 例回顾性验证样本,以及超过 10,000 名患者的常规实践试验。同样重要的是,报告中的收益并不只局限于一个 headline AUC。该系统似乎改变了报告内容,发现了被遗漏的病灶,并将病例升级到多学科评审。
对于一个经常因在临床中承诺过多而遭批评的领域而言,这种规模、工作流程整合与真实世界信号的组合值得注意。LiON 或许不会终结关于诊断影像中 AI 的所有问题,但它提供了近期更清晰的例子之一:一个影像模型不仅在准确性上被测试,也在实际临床有用性上被验证。
本文基于 Nature Medicine 的报道。阅读原文。
Originally published on nature.com



