一款训练为用临床语言推理的病理模型
《Nature Medicine》的一篇新论文介绍了一种病理基础模型,其设计目标是在整张切片层面进行工作,同时还将输出与临床实践中使用的问答式推理方式对齐。该系统名为 PRISM2,研究称它基于 230 万张全切片图像和 1400 万组临床问答对进行训练,这些数据来源于 70 万份病理报告,并发表于 7 月 31 日。
研究人员将 PRISM2 描述为早期计算病理模型的进一步发展。那些早期系统主要聚焦于对图像块进行编码。在他们看来,这些系统推动了该领域的快速进展,但其直接临床实用性仍然有限。PRISM2 旨在通过把组织形态学,也就是组织图像中呈现的内容,与由语言监督表达的诊断推理连接起来,来弥补这一差距。
这种配对很重要,因为病理学并不只是视觉识别任务。在实践中,临床医生会解读整张切片的发现,将其与疾病模式联系起来,并回答特定的诊断问题。作者认为,这种对话式监督为可泛化表征提供了可扩展且具有临床依据的训练信号。
模型的训练数据
根据摘要,该模型的多模态训练将切片级病理数据与大规模文本监督结合在一起。图像部分包含 230 万张全切片图像。语言部分包含由 70 万份病理报告生成的 1400 万组问答对。研究称,这种临床对话监督使 PRISM2 能将视觉组织模式与诊断推理对齐,而不仅仅与标签对齐。
作者写道,这样得到的模型支持两种不同的使用方式。一种是基于提示的推理,模型可以直接回答任务相关提示。另一种是作为可迁移嵌入的来源,可用于下游任务,例如分类、生物标志物研究和生存分析。
这种双用途设计对病理工作流程很重要,因为该领域既包含界定清晰的临床产品,也包含研究环境,在那里团队可能需要可复用的表征层,而不是单一用途的分类器。
PRISM2 在论文中的表现
论文报告称,在基于提示的推理中,PRISM2 在前列腺、乳腺和乳腺淋巴结的癌症检测任务上,达到了或超过了临床级产品的平衡准确率,且统计学显著性为 P < 0.05。这是研究中最明确的实际主张之一,因为它把模型与为临床级检测而构建的系统直接比较,而不仅仅是与研究基线比较。
作者还报告称,在采用线性探测、并在全面的诊断、生物标志物和生存基准上评估时,PRISM2 的嵌入表示在统计上从未低于此前的基础模型,同样达到 P < 0.05。换句话说,在摘要所描述的基准集合中,该模型始终与此前基础模型的表征质量持平或更优,而不是在某一领域提升性能、却以另一领域为代价。
第三项结果指向微调效率。研究称,在生存预测上的任务特定微调,优于在同一大型生存数据集上从头训练。这表明,预训练过程不仅生成了通用特征,也为后续专门任务奠定了坚实基础。
这篇论文为何引人注目
训练语料的规模是这项研究可能吸引关注的一个原因。另一个原因是,它把语言框架为连接视觉病理数据与临床实践的桥梁。医学领域中的许多基础模型工作都聚焦于规模,但这篇论文认为,如果监督信号不能反映病理决策实际如何形成并被传达,那么仅有规模是不够的。
通过强调临床对话,研究人员实际上是在努力让模型更适用于基于提示的任务,并在工作流程层面更具可解释性,尽管摘要并未声称其具有完整的可解释性或可独立临床部署能力。相反,这项研究展示的是一个以诊断推理为基础、并且能够在多类病理任务之间迁移的模型。
这一差异很重要,因为全切片成像会产生极其庞大且信息密集的输入。能够在切片层面推理、而不仅仅依赖局部图像块的模型,可能更有能力捕捉诊断和预后中重要的整体结构背景、组织关系和疾病模式。
这可能带来的后续影响
在论文摘要所限定的范围内,PRISM2 似乎面向研究工具与临床相关模型开发之间的广阔中间地带。文中报告的评估覆盖癌症检测、诊断基准、生物标志物基准和生存基准,这表明作者将该系统定位为通用病理表征模型,而不是一个狭义调优的产品。
这并不意味着论文声称它可以立即在医院中常规使用。摘要重点在于比较性能、表征质量和微调收益。但这项工作之所以值得注意,是因为它提出了下一代病理 AI 的一套具体方案:在超大规模切片数据上训练,使用具有临床意义的语言进行监督,并同时评估直接提示能力与下游适配能力。
如果这一方案在论文所述基准之外也被证明稳健,那么它可能会影响未来病理模型的构建方式,尤其是那些需要把视觉证据与问题驱动的医学推理连接起来的应用。
研究要点
- PRISM2 基于 230 万张全切片图像进行训练。
- 语言监督使用了由 70 万份病理报告生成的 1400 万组问答对。
- 该模型支持基于提示的推理,以及用于下游任务的可迁移嵌入。
- 论文报告称,其在前列腺、乳腺和乳腺淋巴结的多项癌症检测任务上,性能达到或优于临床级产品。
- 研究称,在所测试的基准类别中,PRISM2 的嵌入表示在统计上从未低于此前的基础模型。
更广泛的意义与其说是单一基准的胜利,不如说在于训练策略本身。PRISM2 被视为一种证据,说明语言监督预训练可以把人类诊断推理与病理基础模型性能连接起来。在一个正在寻找既能跨任务泛化、又不失临床相关性的系统的领域,这是一种有意义的转变。
本文基于 Nature Medicine 的报道。阅读原文。
Originally published on nature.com
