决定庭审 AI 是否带来成效的,不只是能否使用,而是是否接受培训
巴基斯坦司法系统的一项大规模随机实地实验表明,人工智能可以提高公共部门生产力,但前提是机构愿意投入培训,帮助人员更好地使用它。这项研究由苏黎世联邦理工学院、伦敦帝国学院和新经济学院的研究人员开展,在 118 家法院的 1,559 名法官中测试了名为 JudgeGPT 的 AI 助手,约占巴基斯坦初审法院法官总数的一半。
最重要的结果并不只是 AI 有帮助,而是仅仅提供访问权限几乎没有什么作用。那些在获得系统使用权限的同时又接受了针对性培训的法官,使用频率高得多,并且与案件结案效率的可衡量提升相关。根据原始材料提供的研究摘要,在接受培训法官占比适中的地区,每年可多结案约 1,848 起,相当于增长 6.3%。
这使得这项实验的意义超出了巴基斯坦本身。世界各国政府都在测试大语言模型,用于法律检索、案件管理、文书起草和行政支持。这项试验补充了一个更清晰的操作层面经验:部署策略和模型本身同样重要。
一套承压严重的司法系统,提供了一个高难度测试场景
巴基斯坦的法院体系为观察哪怕微小的生产力提升是否有价值提供了一个合适场景。研究人员称,该国每 10 万居民不足 2 名法官,而欧盟这一数字为 22,英格兰和威尔士为 30。到 2024 年底,积案达到 226 万起,其中 82% 堆积在初审法院。
这些数字表明,整个系统长期承受巨大压力,人员有限,技术支持稀缺。在实验开始前,只有大约四分之一的法官曾经使用过 ChatGPT 之类的大语言模型。这一点很重要,因为这意味着研究并不是在高频使用者或数字化成熟的官僚体系中测试 AI,而是在一个时间、人员和技术熟悉度都受限的真实法院系统里,检验一个专门助手是否能发挥作用。
JudgeGPT 本身基于 OpenAI 的 GPT-4 构建,并通过检索增强生成适配巴基斯坦初审法院。根据原文,它检索了一个包含 129,235 份文档的数据库,其中包括 128,292 份法院判决和 943 部巴基斯坦法律。对于每个查询,系统会选出最相关的 10 段内容,并生成带引用的答案。
这种设计很重要,因为它收窄了模型的任务范围。与其让一个通用模型凭记忆即兴做法律分析,不如把回应锚定在一套明确的本地法律材料中。实际上,这意味着该工具更像是研究和起草辅助,而不是一个自主裁判者。
最大的收益来自结构化教学
研究人员将法官分为三组。第一组获得 JudgeGPT 访问权限,并接受了有针对性的培训,包括三周内共六节、每节 90 分钟的课程。这些课程重点讲解哪些任务适合该工具、其局限在哪里,以及如何验证其输出。第二组同样获得 AI 系统访问权限,但只参加了一个关于技术与法律的普通研讨会。对照组则只参加研讨会,没有 JudgeGPT 访问权限。
这些组别之间的差异构成了核心发现。接受针对性培训的法官使用该系统的次数,大约是只参加普通研讨会者的四倍。40 周后,受训组平均登录近 60 次,提出超过 200 次提示;对比组平均登录约 20 次,提示数不到 50 次。
使用频率的差异转化为了不同的系统层面结果。受训法官较多的地区,案件结案数量显著增加。根据报告结果,即便是暴露程度处于最低四分位的地区,每年也能多结案约 616 起。

这意味着结论很直接。机构中的 AI 采用,并不只是软件上线的问题,更是工作流程和能力建设的问题。如果没有实际培训,用户可能会低估系统、误解它的作用边界,或者回避让它承担真正重要的工作。有了培训,同一个模型就能成为日常决策支持的一部分。
质量似乎并未下降
如果法院中的生产力提升是以裁判质量或公正性为代价,那么意义就会大打折扣。原文称,裁决质量保持稳定,甚至略有改善。每千件已结案件的上诉率略有下降,而法官的工作时长和工作生活平衡没有明显变化。
这些发现并不能消除围绕司法 AI 的所有担忧,但确实回应了一个常见顾虑:更快的输出是否必然意味着更草率的决定。在这项实验中,报告中的收益并不是来自更长工时或明显的质量退化,而更像是来自更高效的检索和案件处理。
这一差别对正在考虑在超负荷法院、政府机构或公共辩护办公室使用类似工具的政策制定者很重要。如果 AI 被用于筛选相关先例、总结案卷和起草辅助材料,它可能在不把最终法律责任从法官身上移开的情况下缓解瓶颈。
经济学结果让人更难忽视
研究估算,每投入 1 美元可节省约 38.50 美元,这一数字基于雇佣更多法官以获得类似结案增幅的等效成本。这个数字应被视为估算,而非保证能实现的预算结果,但它有助于解释为什么公共机构可能会继续测试类似系统。
在许多国家,增加法官、书记员或法律研究人员的成本高且周期长。培训现有法官使用一款设计聚焦的 AI 助手,可能更便宜也更快,尤其是在案件积压在政治上备受关注、并且会损害制度公信力的时候。一种既能提高吞吐量、又不会延长工时或加剧上诉负担的工具,显然会吸引巴基斯坦以外更多人的注意。
不过,原始材料也给出了一个可以推广的警示。之所以有效,是因为该干预结合了模型访问权限、经过筛选的法律检索,以及关于局限性和核验方式的明确教学。如果去掉这些组成部分,生产力提升的理由就会弱得多。
这项研究为何不只关乎法庭
这项实验更广泛的意义,并不是 AI 可以取代法律判断,而是如果引入方式足够规范,边界清晰的 AI 系统可以提升承压机构的表现。这一经验适用于法院,也适用于税务机构、福利系统、医院、学校和监管机构:人的采用是核心变量,而不是事后补充。
围绕生成式 AI 的公共讨论,至今仍在炒作与否定之间摇摆。这项研究落在一个更有价值的位置。它表明,这项技术确实可以在要求严苛的公共场景中带来真实收益,但前提是满足使这些收益成立的条件:领域专用检索、明确的安全措施,以及训练用户理解工具能做什么、又不该被信任独立完成什么。
对于正在权衡 AI 是否应进入高风险行政系统的政府来说,这或许是最重要的结论。回报并不是来自部署一个模型然后等待变革,而是来自把 AI 当作一种必须被教授、整合和核验的制度能力。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com

