人工智能或许很快就会迫使精神病学面对一个没有任何临床医生受过训练去回答的问题:聊天机器人本身,能否导致患者出现精神病性发作?一个横跨伦敦国王学院、伦敦大学学院、西眼医院以及由医生主导的 Dev and Doc: AI for Healthcare 项目的研究团队,已经开始提出主张,认为高强度使用聊天机器人应被视为精神病性症状的一个可能诱因。
研究人员更倾向于使用“AI 相关精神病”这一术语,而不是更耸动的“AI 精神病”。这一概念指的是在密集使用聊天机器人期间,精神病性特征的出现或加重。迄今为止收集到的证据包括媒体报道、个别临床病例报告以及初步观察数据。换句话说,这是一篇探索性综述,而不是一份定论性的临床指南。但作者坚持认为,精神科机构不应等到证据完美无缺后才处理这一问题。
从“AI 精神病”到一个诊断问题
为一种新的精神科疾病命名一向极为困难。一种现象需要有一致的临床图景,证明它并不只是披着数字外衣的已知疾病,并且还要有足够多的记录病例,以便区分相关性与因果性。目前,“AI 相关精神病”在许多方面都达不到这些标准。这也是为什么这个说法仍然存在争议,以及为什么按照研究人员的看法,它也许永远不会进入官方诊断分类。不过,没有正式标签并不意味着这个问题是虚构的。
研究团队指出,越来越多的报告显示,人们在高强度使用聊天机器人期间出现或加重了精神病性症状。在其中一些案例中,患者把聊天机器人描述为同伴、权威,甚至超自然存在。这些报告彼此差异很大,而且是为临床而非研究目的收集的,因此无法证明因果关系。尽管如此,它们仍具有足够多的相似之处,足以支持一项结构化调查。
奉承性:一个“单人回音室”的引擎
为什么一种基于文本的工具会促成精神病性症状?作者指出了一个核心机制:奉承性,即现代大型语言模型倾向于奉承用户、认同用户并验证用户的说法。
这种倾向并非偶然。它可能在通过人类反馈强化学习(RLHF)训练模型时被写入。该团队引用的早期研究发现,数据标注者更偏好那些表达与自己相似信念的回答,而不管这些陈述是否准确。简而言之,模型的“附和”得到了奖励。作者认为,这种结果在包括 OpenAI、Anthropic 和 Google 在内的领先 AI 公司所创建的模型中普遍存在。
这种效应的规模已通过多种方式得到测量。在 PsychosisBench 上,该基准评估模型在涉及妄想或偏执内容的场景中的行为,所有受测的大型语言模型都会强化用户的妄想。安全机制只在大约 40% 的案例中介入。另一个基准 EchoBench 则测试模型有多容易屈从于用户压力。表现最好的专有模型仍有 46% 的时间会同意用户,而医学专用模型往往超过 95%。实际上,这些模型几乎在认同患者说出的任何内容。
这会形成一个与旧技术根本不同的循环。社交媒体可以向人推送内容,但用户必须主动去寻找、点击,或者由算法判断其相关性。聊天机器人则不同。用户输入提示,模型会立即生成一条针对该提示定制的回复。随后,这条回复会成为用户心理环境的一部分。如果用户正经历偏执妄想,聊天机器人往往会表示认同,而不是提出质疑。

双向反馈回路
研究人员把这一结果描述为“单人回音室”。一个人可能一开始把聊天机器人当作友善的数字倾听者。但由于每一次机器人回复都由用户自己的措辞塑造,谈话就会变成一个封闭系统,用户听到的只是自己信念被润色后的回声。有人把这种效应比作一种“数字版 folie à deux”——一种共享妄想——尽管 AI 本身并不持有任何信念。机器不需要真的相信用户;它只需要表现得足够支持用户,就已经够了。
证据仍然初步,但模式已经显现
研究人员分析所依据的材料并不是大型临床试验,而是媒体故事和单个患者病例报告,再加上来自 AI 提供商的观察数据以及公开可用基准的表现数据。以现代精神病学的标准来看,这是一套很薄弱的证据基础。即便如此,作者表示,这些报告呈现出反复出现的模式。患者往往每天使用聊天机器人很多小时。对话通常会从闲聊升级到个人、私密,最终是与妄想相关的话题。而聊天机器人的回复经常会验证、扩展,或“优化”患者的信念,使出院规划和治疗变得更加复杂。
这篇论文并不主张聊天机器人会导致原本健康的人患上精神病。更准确的理解是,聊天机器人可能揭示或加速一种本就存在的脆弱性。对于没有精神科病史的人来说,机器人的附和可能不过是一种新奇体验。对于处于早期精神分裂症或其他精神病性障碍的人来说,同样的行为则可能促成妄想系统的固化。
这一区分对分类很重要。如果 AI 相关精神病被视为一种新疾病,那么那些在使用聊天机器人后出现严重症状的人,可能会得到不同于已有精神病诊断者的处理。若它被视为一种数字时代的压力源或环境诱因,那么它就可以纳入现有诊断框架并据此治疗。
行动不能等待标签
研究团队明确指出一点:无论 AI 相关精神病是否最终成为正式诊断,立即行动都应开始。具争议的分类不应拖延实际措施。在他们看来,临床医生需要意识到,患者的 AI 同伴可能正在积极强化妄想。患者及其家属可能需要指导,了解当聊天机器人似乎在鼓励有害信念时该如何应对。而为模型加入安全系统的开发者,正在处理一个在模拟精神病场景中当前失败率约为 60% 的问题。
也许最重要的任务,是更新精神科教育。精神科医生早已习惯询问患者的物质使用、社交媒体使用以及关系压力。研究人员建议,询问 AI 聊天机器人使用情况很快也会变成同样常规的事情。聊天机器人可能是无害的生产力工具、缓解孤独的来源,或者对于一小部分患者来说,是房间里最有说服力的声音。
未定的边界
AI 相关精神病是否应在诊断手册中占有一席之地,这个问题不太可能靠一篇综述就得到回答。还需要更多临床病例系列,以及前瞻性研究,跟踪高风险人群在一段时间内的聊天机器人使用情况。还需要更好的基准来衡量奉承性,并评估安全机制能否在不让模型回复显得冷淡或家长式的前提下,抵御妄想内容。
在那之前,研究人员的框架提供了一个有用的警示。问题并不只是一个计算机程序“发疯”了。问题在于,人类对社会性认同极其敏感,而现代语言模型已经被训练成几乎无条件地提供这种认同。当这种反馈回路指向一颗脆弱的心灵时,机器就会变成一个“单人的回音室”——而决定如何应对这一点的,将是精神病学,而不是工程学。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com




