Lorsque Thibault Schrepel a conçu son cours « Law of AI » à la Vrije Universiteit Amsterdam, il est arrivé en classe avec une hypothèse courante : confier à des étudiants un chatbot IA sans aucune instruction risquait de faire plus de mal que de bien. Deux années de tests contrôlés l'ont conduit à la conclusion inverse. Selon ses propres mots, « je me trompais ».

L'expérience qu'il a menée est remarquable moins pour son titre que pour sa structure. Plutôt que d'interroger les étudiants sur leurs attitudes envers l'IA, Schrepel les a répartis en groupes soumis à des règles différentes, puis a mesuré ce qu'ils produisaient réellement. Le même dispositif a été reproduit deux fois — d'abord en 2024 avec 66 étudiants, puis en 2025 avec 164 participants — ce qui lui a permis d'observer non seulement si l'IA aidait, mais aussi si la manière dont elle était introduite importait avec le temps.

Comment fonctionnait l'expérience à trois groupes

Chaque participant faisait face à la même tâche centrale : travailler en petites équipes de quatre ou cinq personnes, avec 20 minutes pour améliorer une disposition de l'EU AI Act. Les soumissions étaient notées sur le fond, la clarté, la proportionnalité et l'innovation — des critères qui récompensent un véritable raisonnement juridique plutôt qu'un simple polissage de surface. Tous les étudiants passaient également les mêmes évaluations : un examen à choix multiples et un examen à emporter leur demandant de réviser une autre disposition du règlement.

La seule variable était la manière dont ils étaient autorisés à travailler :

  • Sans IA : Ce groupe était totalement privé de ChatGPT et devait s'appuyer sur la discussion et ses propres connaissances juridiques.
  • IA non encadrée : Ces équipes recevaient des suggestions de révision générées par ChatGPT intégrées directement dans le texte. Elles pouvaient continuer à utiliser l'outil, mais personne ne leur expliquait comment le solliciter ni comment évaluer ce qu'il renvoyait.
  • IA encadrée : Ce groupe recevait un enseignement pratique du prompt engineering juridique, ainsi qu'une formation explicite à la vérification de la cohérence et de l'exactitude des sorties de l'IA.

Le groupe sans IA s'est heurté à un mur appelé « épuisement des idées »

Les étudiants travaillant sans IA ont terminé derniers lors des deux années de l'étude. Leurs modifications étaient superficielles : reformuler des phrases pour plus de clarté, supprimer des redondances, resserrer la formulation. Seul un petit nombre de sous-groupes a tenté des améliorations juridiques substantielles de la disposition. Plus frappant encore était le timing. Après environ dix à quinze minutes, de nombreuses équipes étaient à court d'idées à tester — un schéma que Schrepel qualifie d'« épuisement des idées ».

L'interdiction a tout de même produit un bénéfice que le chercheur reconnaît. Sans chatbot sur lequel s'appuyer, les étudiants débattaient davantage entre eux, élaborant le texte par une véritable discussion. Le compromis, cependant, était un plafond sur la distance que cette discussion pouvait parcourir dans le temps imparti.

Utilisation non encadrée de l'IA : des productions fluides, peu de scrutin

Si le groupe sans IA souffrait d'un manque d'idées, le groupe non encadré souffrait d'un manque de scepticisme. Les étudiants de la condition intermédiaire acceptaient largement ce que ChatGPT proposait, justifiant fréquemment un changement par le fait que la version de l'IA « sonnait simplement mieux ». Dans certains cas, les participants remplaçaient des termes tels que « shall » et « individual » par des alternatives suggérées par l'IA sans démontrer la moindre compréhension des conséquences juridiques d'un tel remplacement — une substitution qui a un poids réel dans la rédaction législative.

Chaque sous-groupe de cette condition a conservé au moins un terme trompeur ou juridiquement superflu issu de la production de ChatGPT. Le problème n'était pas que l'outil produisait un texte inutile ; c'est que le texte arrivait suffisamment poli pour décourager toute remise en question.

Une formation structurée a produit un véritable dialogue avec l'outil

Le troisième groupe s'est comporté différemment. Ces étudiants contestaient le modèle, testaient des formulations alternatives et interrogeaient les questions juridiques de fond sous-jacentes à l'exercice plutôt que d'accepter le premier brouillon plausible. Leurs notes l'ont reflété : en 2024, le groupe formé a largement surpassé les deux autres, l'avantage étant le plus visible à l'examen à emporter, plus exigeant.

L'avantage de la formation a presque disparu la deuxième année

Puis le schéma s'est déplacé. Lorsque l'expérience a été répétée en 2025, l'écart s'était presque refermé. Les trois groupes ont atteint à peu près le même niveau de performance, y compris les étudiants qui n'avaient aucun accès à l'IA.

L'explication de Schrepel est simple : la familiarité. À mesure que les chatbots sont devenus une partie normale de la vie quotidienne, les étudiants arrivaient en classe en sachant déjà comment travailler avec eux. L'enseignement formel gardait de la valeur, mais ne conférait plus le même avantage qu'un an plus tôt, lorsque l'outil était moins intégré au travail académique de routine.

Cette conclusion complique toute lecture politique simpliste. Elle suggère que le bénéfice de la formation dépend en partie des compétences de base — précieuse lorsqu'un outil est nouveau, moins différenciante une fois qu'il devient ambiant.

Ce que les enseignants devraient retenir des résultats

Plusieurs observations pratiques émergent de ces deux années :

  • Retirer l'IA d'un exercice à durée limitée n'a pas amélioré la qualité du travail des étudiants ; dans ce cours, cela l'a diminuée.
  • Autoriser l'IA sans instruction a laissé les étudiants vulnérables à des erreurs à l'apparence convaincante qu'ils n'avaient pas l'expertise de détecter.
  • Apprendre aux étudiants à interroger les sorties de l'IA — vérifier la cohérence, contrôler l'exactitude, solliciter délibérément — a produit des résultats mesurablement meilleurs, du moins tant que cette compétence était peu répandue.
  • Le déficit de connaissances en littératie de l'IA se comble de lui-même à mesure que les étudiants acquièrent une expérience quotidienne de ces outils.

La leçon plus large est que la distinction pertinente n'est peut-être pas IA contre absence d'IA, mais usage encadré contre usage non encadré. L'avantage du groupe formé venait du fait de traiter le chatbot comme quelque chose à défier plutôt qu'à obéir, et c'est cette habitude, et non l'outil lui-même, qui semble avoir entraîné l'amélioration des résultats.

Il convient de garder en perspective la portée de l'étude. Les conclusions proviennent d'un seul cours, d'un seul enseignant et d'une seule discipline, avec des cohortes relativement modestes. La rédaction juridique est en outre un domaine où la précision compte d'une manière qui peut ne pas se transposer proprement à d'autres sujets.

Néanmoins, l'arc de deux ans donne à ces résultats un poids inhabituel. Schrepel s'attendait à ce que l'IA non encadrée se retourne contre les étudiants, et les données ont refusé de se plier à cette attente. Sa conclusion est un correctif utile pour les institutions qui envisagent des interdictions pures et simples : la prohibition a supprimé une source d'idées sans éliminer le besoin de jugement, tandis que l'enseignement d'un usage responsable de l'outil a livré le gain mesurable le plus important.

Cet article est basé sur un reportage de The Decoder. Lire l'article original.

Originally published on the-decoder.com