为手术室压力环境而设计的模型
术中病理学处于精准外科手术的核心位置,在患者仍躺在手术台上时,为外科医生提供所需的组织层面信息。然而,这些信息的来源——冰冻切片——长期以来一直是瓶颈。这项工作在诊断上十分复杂,样本在时间压力下难以判读,而足以训练现代计算工具的高质量冰冻切片数据集一直十分稀缺。这些限制制约了术中病理学在临床中实际能够产生的影响力。
计算病理学近年来取得了长足进展,但该领域一直面临一个持续存在的可信度缺口:缺乏大规模前瞻性验证,使大多数算法无法进入常规手术工作流程。一项新发表于Nature Medicine的研究描述了一项旨在直接弥合这一缺口的工作。研究人员推出了CRISP,这是一种完全基于冰冻切片玻片构建的视觉病理基础模型,其明确目标是提供面向临床的稳健术中病理支持(Clinically-oriented Robust Intraoperative Support for Pathology)。
该研究以开放获取的已接收稿件形式提前发布,以便经同行评审的研究结果能够更快传播。该版本带有永久DOI并可被引用,但作者指出,在最终正式版本(Version of Record)取代之前,内容仍可能进一步修改。
规模化训练:来自十家中心的10万张冰冻切片
该基础模型使用从十家医疗中心收集的超过10万张冰冻切片进行开发。该数据集不仅因其规模而引人注目,也因其构成而值得关注。冰冻切片不同于大多数计算病理学研究中占主导地位的福尔马林固定、石蜡包埋切片——它们是在手术过程中快速制备的,其视觉特征也反映了这种紧迫性。通过完全基于冰冻切片材料进行训练,开发者旨在构建一个与术中决策实际条件相匹配的系统,而不是将一个为不同成像场景构建的模型加以改造。
CRISP被描述为面向临床,这一框架贯穿其训练设计和评估策略。该研究并非单纯针对基准性能进行优化,而是将真实手术效用作为成功的衡量标准。
覆盖近100项诊断任务的回顾性测试
评估阶段涵盖超过15,000张术中玻片和近100项回顾性诊断任务。这些任务刻意覆盖了广泛的临床问题,包括:
- 良恶性鉴别
- 关键术中决策场景
- 泛癌种检测
在这一系列任务中,CRISP在六家机构、14种肿瘤类型和24个解剖部位上展现出稳健的泛化能力。重要的是,这一范围包括模型在训练中未曾接触过的解剖部位以及罕见癌症——这些正是窄域训练系统往往容易失败的边缘情况。对于一款旨在支持不同专科和医院环境下外科医生的工具而言,能够泛化到未见部位和少见肿瘤类型是一个有意义的信号。
在超过3,000名患者中的前瞻性验证
该研究最具影响力的部分是其前瞻性组成。CRISP在一个超过3,000名患者的前瞻性队列中接受了评估,这一场景将评估从经过筛选的回顾性玻片推进到真实世界诊疗的复杂条件中。在这些条件下,该模型保持了较高的诊断准确性。
最核心的临床发现是:CRISP在92.6%的病例中直接为手术决策提供了依据。这一数字体现的是整合,而不仅仅是预测——模型的输出并非只是与参考标签进行比较,而是在做出手术选择的当下被实际使用。
人机协作与工作负担缓解
该研究还考察了当病理学家与模型协同工作而非各自独立工作时会发生什么。根据报告结果,人机协作带来了若干具体益处:
- 诊断工作量下降35%
- 避免了105项辅助检测
- 微转移检测准确率达到87.5%
这些结果分别针对外科病理学中的不同压力点。工作量减少对于周转时间紧张、人员配置有限的科室尤为重要。避免辅助检测则对成本、资源使用以及额外检测可能在手术过程中造成的延迟具有意义。微转移检测改善则直指该领域最难的问题之一,即少量肿瘤细胞沉积容易被遗漏,而一旦漏诊后果重大。
冰冻切片为何难以实现自动化
要理解CRISP的意义,需要认识到术中病理学为何落后于计算医学的其他领域。其诊断复杂性相当高:冰冻切片的形态可能因冷冻过程而失真,病理学家必须在组织有限的情况下快速作出判断。与此同时,与可用于研究的大量永久切片库相比,大多数机构的冰冻切片档案记录是碎片化的。
困难图像、快速决策、数据稀薄——这种组合正是依赖大型且具代表性训练语料的基础模型难以立足的环境。汇集十家中心超过10万张冰冻切片,代表了一项协调一致的多机构努力,以克服这一结构性障碍。
这些结果对外科实践意味着什么
综合来看,这些发现使CRISP成为一种面向临床的AI驱动术中病理学方法,具有支持手术决策并帮助将计算方法转化为日常实践的潜力。该研究的设计——多中心训练、包括未见部位和罕见癌症在内的广泛回顾性测试,随后在数千名患者中进行前瞻性验证——契合了监管机构和医院系统在信任某款工具进入手术室之前通常期望的证据路径。
问题当然仍然存在。在更广泛机构中的持续性能、针对模型漂移的长期监测,以及在时间敏感的手术环境中部署基础模型的实际后勤问题,都是后续研究需要解决的领域。该稿件本身是早期可引用的发布版本,而非最终正式版本,作者也承认内容可能会更新。
尽管如此,报告的数字仍具体展示了手术室中的人机协作可能是什么样子:一个在绝大多数病例中为手术决策提供依据的诊断伙伴,承担了约三分之一的报告负担,避免了100多项辅助检测,并改善了微转移检测。对于一个分秒必争且准确性不容妥协的专科而言,这是朝着让计算病理学成为手术工作流程常规组成部分、而非仅仅是有前景的研究设想迈出的有意义一步。
本文基于Nature Medicine的报道。阅读原文。
Originally published on nature.com



