用于视网膜疾病诊断的AI助手在试验中取得强劲结果

一项发表在《Nature Medicine》上的多中心随机试验报告称,人工智能临床决策支持系统能显著提升疑似遗传性视网膜疾病的诊断表现。这类疾病在常规诊疗中往往难以快速、准确地分类。

该系统名为 Retina4IRD,旨在帮助专科医生根据视网膜影像预测可能的基因型类别。在试验中,使用该工具的专家,其 top-5 基因预测准确率明显高于未使用该工具的专家。这个结果回应了眼科长期存在的一个瓶颈:遗传性视网膜疾病通常需要复杂的表型分析、多学科解读和基因检测,才能得出明确诊断。

遗传性视网膜疾病,简称 IRDs,并不是单一疾病,而是一组影响视网膜的遗传性病症。它们在临床表现上可能高度重叠,因此医生往往需要结合多种证据,才能缩小最可能病因的范围。这个过程可能很慢、很耗资源,而且在不同医疗环境中的质量也并不均衡,尤其是在深度亚专科经验有限的地方。

Retina4IRD 如何构建

根据研究,Retina4IRD 可从视网膜图像中预测 17 个基因型类别。研究团队使用经过 RETFound 预训练的 Vision Transformer 架构开发该模型,并用来自中国、韩国和波兰的已知致病基因确诊患者的多模态影像数据对其进行训练和验证。

数据集包含 1,843 名基因确诊患者的彩色眼底照片和光学相干断层扫描,共计 3,376 只眼睛。这样的国际训练与验证集很重要,因为 IRD 的诊断不仅受疾病类型多样性影响,也受各地影像实践差异影响。因此,外部验证表现是检验一个系统能否走出其开发机构的重要考验。

在内部验证中,模型的 top-5 预测准确率达到 0.904,95% 置信区间为 0.896 至 0.912。在外部验证中,top-5 准确率为 0.856,95% 置信区间为 0.850 至 0.863。这些数据表明,该模型即使在开发环境之外评估,仍然保持了较强表现,不过与内部测试相比出现了符合预期的下降。

研究将这一工具定位为临床判断和基因测序的决策支持,而不是替代者,它的作用是帮助临床医生更早地在诊断路径中优先考虑最可能的遗传解释。

随机试验显示专科医生表现提升

论文中最有力的证据来自一项随机对照试验,涉及 300 名疑似 IRD 患者。参与者按 1:1 分配到 Retina4IRD 辅助专科医生组或仅由专科医生诊疗的对照组。其中 295 名参与者有可用的二代测序报告,并纳入最终分析。

纳入分析者的中位年龄为 33 岁,其中 114 人,即 38.6%,为女性。研究的主要终点得到了满足。使用 AI 支持工具的专科医生,其 top-5 基因准确率为 88.5%,而仅由专科医生诊疗组为 67.3%。论文报告这一差异具有统计学意义,P 值小于 0.001。

论文还指出,覆盖 top-1 到 top-4 准确率的次要终点也都支持 Retina4IRD 辅助组。综合来看,这些结果说明该系统并不只是简单地在长名单里增加更多选项,而是提升了预测排序质量,使最有可能的基因类别更有机会排在前列。

这一区别在实践中很重要。如果专科医生能够从影像中识别出更少但质量更高的候选基因型类别,后续检测和解读就可能更加聚焦。在基因检测能力受限的环境中,更好的前端分诊信号有助于更有效地分配专科资源。

这些发现可能改变什么

这篇论文的重要性在于其证据类型。许多医疗 AI 研究止步于回顾性验证,只是在历史数据上测试算法,而没有在真实或准真实的临床流程中评估。这里,研究人员进一步进行了随机对照比较,让 AI 辅助专科医生与未辅助专科医生直接对比。

这并不意味着所有部署问题都已解决。所提供的研究文本并未声称 Retina4IRD 可以独立给出最终诊断,也没有暗示可以跳过基因检测。相反,结果指向了 AI 在罕见病医学中的一个更现实的短期角色:在诊断依赖稀缺专家经验和大量时间审阅的地方,提升决策支持能力。

跨国数据集也暗示了更大的野心。IRDs 的罕见程度使得构建稳健训练数据非常困难,而国际协作通常是捕捉有临床意义差异所必需的。如果进一步研究能在更广泛的人群和医疗体系中确认这些结果,视网膜影像模型可能会成为图像采集与分子确认之间越来越重要的一层。

就目前而言,最核心的结论很直接。在随机、多中心环境中,一个基于 AI 的支持系统显著提高了专家对疑似遗传性视网膜疾病背后基因类别的预测能力。在一个诊断延误可能影响治疗决策、遗传咨询以及未来基因定向治疗资格的领域,这是一项重要进展。

本文根据《Nature Medicine》的报道改写。阅读原文

Originally published on nature.com