当Thibault Schrepel在阿姆斯特丹自由大学设计他的“AI法律”课程时,他带着一个常见的假设走进教室:在没有任何指导的情况下把AI聊天机器人交给学生,很可能弊大于利。两年的对照测试却把他推向了相反的结论。用他自己的话说:“我错了。”

他进行的这项实验,其引人注目之处与其说在于标题式结论,不如说在于其结构。Schrepel没有去调查学生对AI的态度,而是把他们分成适用不同规则的小组,然后衡量他们实际产出的内容。同样的设置运行了两次——先是2024年,66名学生;然后是2025年,164名参与者——这让他不仅能观察AI是否有帮助,还能观察引入AI的方式是否随时间推移而变得重要。

三组实验是如何进行的

每位参与者都面对同样的核心任务:以四到五人的小组合作,在20分钟内改进《欧盟人工智能法案》的一项条款。提交内容按实质性、清晰度、比例性和创新性评分——这些标准奖励的是真正的法律推理,而非表面上的润色。所有学生还要参加相同的评估:一场多项选择题考试,以及一场带回家完成的考试,要求他们修订该法规的另一项条款。

唯一的变量是他们被允许如何工作:

  • 无AI:该组被完全禁止使用ChatGPT,必须依靠讨论和自身的法律知识。
  • 无指导AI:这些小组收到直接嵌入文本的ChatGPT生成的修订建议。他们可以继续使用该工具,但没有人教他们如何提示它,也没有人教他们如何评估它返回的内容。
  • 受训AI:该组接受了法律提示工程方面的实操指导,以及明确培训,学习如何检查AI输出的一致性和准确性。

无AI组撞上了一堵名为“想法枯竭”的墙

不使用AI的学生在研究的两年中都排名垫底。他们的修改偏向表面化:为清晰而改写句子、删减冗余、精简措辞。只有少数子小组尝试对该条款进行实质性法律改进。更引人注目的是时间点。大约十到十五分钟后,许多小组就无计可施了——Schrepel将这种模式称为“想法枯竭”。

这项禁令确实产生了一个研究者承认的好处。没有聊天机器人可以依赖,学生之间的争论更多,通过真正的讨论反复推敲文本。然而,代价是在时间限制内,这种讨论所能达到的深度存在上限。

无指导AI使用:输出流畅,却鲜有审视

如果说无AI组苦于想法太少,那么无指导组则苦于怀疑太少。处于中间条件的学生在很大程度上接受了ChatGPT提出的内容,常常以AI版本只是“听起来更好”为由为某项修改辩护。在某些情况下,参与者把“shall”和“individual”等术语替换为AI建议的替代词,却没有表现出对这样做所带来的法律后果有任何理解——而在成文法起草中,这种替换具有实实在在的分量。

该条件下的每一个子小组都至少保留了ChatGPT输出中的一个具有误导性或法律上无关的术语。问题不在于该工具产生了无用的文本;而在于文本呈现得足够精致,以至于让人不愿质疑。

结构化培训促成了与工具的真正对话

第三组的表现不同。这些学生对模型提出反驳,测试不同的措辞,并审视作业背后的实质性法律问题,而不是接受第一份看似合理的草稿。他们的分数反映了这一点:2024年,受训组的成绩远超另外两组,这一优势在要求更高的带回家考试中表现得最为明显。

第二年,培训优势几乎消失

随后,模式发生了变化。2025年重复该实验时,差距几乎已经消失。三个组的表现大致处于同一水平,包括那些完全无法使用AI的学生。

Schrepel的解释很直接:熟悉度。随着聊天机器人成为日常生活的一部分,学生走进教室时就已经知道如何与它们协作。正式指导仍有价值,但它不再像一年前那样带来同样的优势,当时该工具在常规学术工作中还没有那么根深蒂固。

这一发现使任何简单的政策解读都变得复杂。它表明,培训的益处部分取决于基线技能——当工具还很新颖时很有价值,一旦它变得无处不在,区分度就降低了。

教育工作者应从结果中吸取什么

从这两年的运行中可以得出若干实际观察:

  • 在限时练习中移除AI并没有提高学生作业的质量;在这门课程中,它降低了质量。
  • 允许使用AI却不加指导,使学生容易受到听起来自信的错误影响,而他们缺乏发现这些错误的专业能力。
  • 教学生审视AI输出——检查一致性、核实准确性、有意识地提示——产生了可衡量的更好结果,至少在这项技能尚不普遍时如此。
  • 随着学生在这些工具上获得日常经验,围绕AI素养的知识差距正在自行缩小。

更广泛的教训是,有意义的区分可能不是有AI与无AI,而是有指导与无指导的使用。受训组的优势来自把聊天机器人当作需要挑战而非服从的对象,而似乎是这种习惯,而非工具本身,推动了结果的改善。

有必要正确看待这项研究的范围。这些发现来自单一课程、单一教师和单一学科,且队列规模相对有限。法律起草也是一个精确性至关重要的领域,其方式可能无法干净地映射到其他学科。

尽管如此,两年的时间跨度赋予了这些结果不同寻常的分量。Schrepel一开始预期无指导AI会适得其反,而数据却拒绝配合这一预期。他的结论对正在权衡彻底禁令的机构来说是一个有用的纠正:禁止移除了一种想法来源,却没有消除对判断力的需求,而关于如何负责任地使用该工具的指导则带来了最大的可衡量收益。

本文基于The Decoder的报道。阅读原文

Originally published on the-decoder.com