大型语言模型可能会在招聘任务中生成自己的刻板印象

关于人工智能用于招聘的警告,通常聚焦于一个熟悉的风险:如果模型使用带有偏见的历史数据训练,它可能会复制并放大这些偏见。Gizmodo 强调的一项新研究提出了一个更令人不安的可能性。大型语言模型未必只是映射人类偏见。在某些条件下,它们可能会自行制造新的社会偏见。

这项研究由普林斯顿大学和芝加哥大学的学者完成,他们在一个受控的招聘游戏中测试了语言模型。此前,这个游戏曾用于人类参与者。研究设置移除了现实世界中的族裔类别,改用虚构群体,使研究人员能够观察在不存在真实群体差异时刻板印象是如何形成的。

根据研究摘要,结果显示语言模型形成的偏见往往比人类参与者更强。这个发现很重要,因为它改变了政策讨论的方向。如果问题只来自受污染的历史数据,开发者或许可以主张,通过更好的数据筛选、去偏或训练语料审计,就能解决大部分问题。但如果模型也会在决策任务中通过自身的奖励寻优行为生成歧视模式,那么治理挑战就要广泛得多。

对虚构人口群体的受控测试

在实验中,应聘者被分配到四个虚构族群之一:Tufa、Aima、Reku 或 Weki。除此之外,他们在任何岗位上成功的可能性都完全相同。参与者无论是人类还是机器,都必须把申请者分配到工作岗位,然后收到这次招聘决策是否成功的反馈。

这个反馈回路至关重要。一旦参与者在把某个虚构群体的成员安排到特定岗位后收到负面结果,他们往往就会更不愿意再次做出同样的搭配。人类在早先版本的游戏中表现出了这种倾向,而且有时即使在游戏结束后,他们仍会把学到的偏见延续下去。

语言模型的表现与此类似,但更强烈。研究摘要称,这些模型的偏见率高于人类,并且能够围绕完全人工构造的群体自发形成社会刻板印象。由于这些群体是虚构的,而且应聘者按设计在能力上完全相当,观察到的歧视不可能由真实群体差异解释。

这让结果更具分量。它表明,即使在没有事实基础的情况下,模型也可能从稀疏反馈转向持久的、基于类别的假设。放到实际场景中,这意味着一个被优化用于反复做出人员决定的系统,可能会因为在不确定性下这样做最有效率,而滑向粗糙的模式化判断。

为什么“探索-利用”权衡很重要

研究人员将这一结果与决策科学中的一个经典原则联系起来,也就是“探索-利用”权衡。在不确定情境中,行为主体既可以进行探索,尝试自己了解较少的选项,也可以进行利用,继续坚持那些看起来曾经有效的选择。

人类无时无刻不在这样做。但人在决策中也会带入道德规范、犹豫和社会约束,从而抑制纯粹追求奖励最大化的行为。研究认为,AI 系统较少有动力去探索,而更倾向于围绕有限反馈中看起来能带来更好结果的东西进行优化。这就形成了刻板印象生成的路径。

一旦模型推断出某个类别在特定岗位上可能与成功或失败相关,它就可能继续利用这一假设,而不是去挑战它。危险不只是这个假设是错的,而是系统会把随机性变成规则,然后像这条规则真的有意义一样行事。

这对招聘软件、简历筛选工具,以及用于总结或排序候选人的 AI 助手都有明显影响。即使设计者去掉了对种族、性别或其他受保护特征的明确引用,模型仍可能在工作流中出现类别或代理变量时形成替代性的模式。研究表明,偏见可能从决策过程本身中产生,而不仅仅来自背后的训练档案。

能力更强的模型未必更安全

来源摘要中的另一项值得注意的发现是,研究人员测试了来自 OpenAI、Anthropic、DeepSeek、Meta、Google 和阿里巴巴等主要供应商的 15 个模型。最引人注目的结果之一是,在同一模型家族内,更新、更大的模型以及推理能力更强的模型,往往产生更有偏见的结果。

这与公众常见的一种叙事相悖,即更先进的模型在敏感领域会自然变得更值得信赖。更好的推理能力可以提升许多任务的表现,但这项研究表明,它也可能让模型更有效地锁定狭窄的、追求奖励最大化的策略,并将其固化为歧视性行为。

摘要特别指出,在测试系统中,OpenAI 的 o3 推理模型对这些虚构申请者的分层最为严重。单凭这一点,并不能说明任何单个模型在真实招聘产品中的具体表现。但它确实强调了一个更广泛的结论:基准测试的提升和推理能力的增强,不能替代在真实决策条件下进行的公平性测试。

企业和监管者应从中得到什么

对雇主而言,最直接的结论是,“AI 辅助”并不等于没有偏见。若模型能够通过反复的反馈回路制造类别偏好,那么供应商声称系统避免了明确的人类偏见,这个标准就过于狭窄了。采购团队需要询问:模型会如何随时间变化、如何更新或强化模式,以及它是否被用于一个错误泛化会直接影响人们机会的领域。

对监管者而言,这项研究支持从单次静态审计转向更动态的监管方式。对固定数据集进行的一次性测试,可能无法发现一个会在与结果、用户提示或下游优化信号交互后变得更具歧视性的系统。监督可能需要包括基于模拟的压力测试、持续监控,以及更明确的规则,界定何时应当完全避免在高风险筛选中使用 AI。

更深层的问题在于概念层面。公众讨论常把 AI 偏见框定为历史遗留问题:社会曾经不公平,数据记录了这种不公平,模型于是继承了它。这项研究表明,一些系统也可能是新的不公平制造机,它们会因为这样做在任务中更有工具性价值,而从弱信号中拼装出刻板印象。

这种可能性应当进一步收紧语言模型在招聘中的可接受用途。至少,它说明必须进行更严格的人类审查,并且对自动排名保持怀疑。在最糟糕的情况下,这可能意味着某些就业决策敏感到根本不该交给那些能把噪声转化为社会判断的系统。

本文基于 Gizmodo 的报道。阅读原文

Originally published on gizmodo.com