通用AI得分高于专业临床工具
《Nature Medicine》发表的一项新的独立评估显示,前沿通用大语言模型在三项独立医学基准测试中,表现优于两款专业临床AI产品。研究比较了OpenEvidence和UpToDate Expert AI,以及GPT-5.2、Gemini 3.1 Pro Preview和Claude Opus 4.6。
这一结果与行业中的常见假设相悖:即专为医学设计的临床产品,凭借领域专用训练或检索系统,理应稳定优于更广泛的模型。在这项评估中,事实并非如此。
论文将这一发现界定为对医院、临床医生和医疗系统的实际警示,这些机构可能正在考虑在缺乏强有力外部验证的情况下快速部署专有医疗AI。作者认为,尤其在底层架构和训练流程并不公开时,关于临床性能更优的说法必须经过独立检验。
比较是如何进行的
评估分为三阶段。首先,研究人员使用500道MedQA题目测试医学知识。其次,使用500个HealthBench条目衡量模型输出与临床医生的一致程度。最后,他们基于100个匿名化问题构建了一个真实临床查询基准,这些问题是医生在真实临床环境中向通用语言模型提出的。
第三阶段是论文中最值得注意的部分,因为它试图超越抽象的基准分数。在真实临床查询集合中,12名美国临床医生对模型输出进行了随机、盲法审查,生成了1,800条模型-问题标注。
在全部三项评估中,前沿通用模型都优于两款临床AI工具。论文还指出,在真实临床查询基准上,这些临床工具的表现与Google Search AI Overview相当。
这一结果为何重要
专业临床AI已经开始进入医疗实践,但论文指出,独立的真实世界评估仍然稀缺。这一缺口很重要,因为医疗系统被要求信任的工具,其内部设计、训练数据和模型选择往往并不透明。
该研究并没有声称通用模型可以自动安全地用于无监督医疗场景。相反,其核心观点更窄,但也更重要:专业化本身不应被视为更好性能的证据。如果一个产品宣称自己经过医学调优,那么仍然需要由供应商和购买方证明,它在临床相关任务上确实表现更好。
这对采购和治理有直接影响。医院在品牌临床助手与经过机构安全护栏包裹的前沿模型之间做选择时,未必是在不同性能层级之间作出明确取舍。根据这项评估,更通用的系统在有意义的指标上可以与专业系统持平甚至超越。
对专有优势的挑战
这篇论文也反映了AI领域更广泛的变化。前沿模型受益于超大规模训练语料和广泛的对齐工作。作者认为,这些进展如今可能已经强大到足以在无需窄范围再训练的情况下,对领域专用产品形成挑战。
这并不意味着每个通用模型都会在每种场景下击败每一种临床工具。但这确实意味着,过去那种“专业化必然带来决定性优势”的论点,似乎比许多买家以为的更弱。
这项比较尤其重要,因为这些临床工具已经被作为面向大规模医疗实践的产品进行推广。在这种背景下,表现不佳不仅是学术结果,也会引发对安全、价值以及“专业”品牌是否跑在证据前面的质疑。
医疗系统应如何看待
从这项研究中最可取的结论不是医疗应放弃专业AI,而是评估标准需要提高。在任何系统被投入实践之前,对真实临床任务进行独立测试似乎是必不可少的。
这也是论文最强的贡献。它把真实世界证据置于营销分类之上,并提醒买家,模型标签的重要性可能不如实际测得的性能。在一个错误会带来严重后果的领域,这一区分绝非理论问题。
- 《Nature Medicine》对两款专业临床AI工具与三款前沿通用模型进行了评估。
- 前沿模型在MedQA、HealthBench和真实临床查询基准上都优于临床工具。
- 真实世界部分使用了100个匿名医生查询和1,800条临床医生标注。
- 作者表示,在临床部署前需要更强的独立评估。
本文基于《Nature Medicine》的报道。阅读原文。
Originally published on nature.com



