Als Thibault Schrepel seinen Kurs „Law of AI“ an der Vrije Universiteit Amsterdam konzipierte, brachte er eine gängige Annahme mit in den Hörsaal: dass es Studierenden wahrscheinlich mehr schade als nütze, ihnen einen KI-Chatbot ohne jede Anleitung in die Hand zu geben. Zwei Jahre kontrollierter Tests drängten ihn zur entgegengesetzten Schlussfolgerung. Mit seinen eigenen Worten: „Ich lag falsch.“
Das Experiment, das er durchführte, ist weniger wegen seiner Schlagzeile bemerkenswert als wegen seines Aufbaus. Statt Studierende zu ihren Einstellungen gegenüber KI zu befragen, teilte Schrepel sie in Gruppen mit unterschiedlichen Regeln ein und maß dann, was sie tatsächlich produzierten. Derselbe Aufbau lief zweimal – zuerst 2024 mit 66 Studierenden, dann erneut 2025 mit 164 Teilnehmenden –, was ihm erlaubte zu beobachten, nicht nur ob KI half, sondern ob die Art ihrer Einführung über die Zeit eine Rolle spielte.
Wie das Drei-Gruppen-Experiment funktionierte
Alle Teilnehmenden standen vor derselben Kernaufgabe: In kleinen Teams von vier oder fünf Personen hatten sie 20 Minuten Zeit, eine Bestimmung des EU AI Act zu verbessern. Die Abgaben wurden nach Substanz, Klarheit, Verhältnismäßigkeit und Innovation bewertet – Kriterien, die echtes juristisches Denken belohnen statt oberflächliche Politur. Alle Studierenden absolvierten zudem dieselben Prüfungen: eine Multiple-Choice-Klausur und eine Take-Home-Klausur, in der sie eine separate Bestimmung der Verordnung überarbeiten sollten.
Die einzige Variable war, wie sie arbeiten durften:
- Keine KI: Diese Gruppe durfte ChatGPT überhaupt nicht nutzen und musste sich auf Diskussion und ihr eigenes juristisches Wissen verlassen.
- Unangeleitete KI: Diese Teams erhielten von ChatGPT generierte Überarbeitungsvorschläge, die direkt in den Text eingebettet waren. Sie durften das Tool weiter nutzen, aber niemand erklärte ihnen, wie man es anleitet oder wie man bewertet, was es zurückgibt.
- Geschulte KI: Diese Gruppe erhielt praktische Anleitung im juristischen Prompt Engineering sowie explizites Training darin, KI-Ausgaben auf Konsistenz und Genauigkeit zu prüfen.
Die Ohne-KI-Gruppe stieß an eine Wand namens „Ideenerschöpfung“
Die Studierenden, die ohne KI arbeiteten, landeten in beiden Jahren der Studie auf dem letzten Platz. Ihre Änderungen waren überwiegend oberflächlich: Sätze zur Klarheit umformulieren, Redundanz streichen, Formulierungen straffen. Nur eine kleine Zahl von Untergruppen versuchte substanzielle juristische Verbesserungen der Bestimmung. Auffälliger war das Timing. Nach etwa zehn bis fünfzehn Minuten gingen vielen Teams die Dinge aus, die sie ausprobieren konnten – ein Muster, das Schrepel als „Ideenerschöpfung“ bezeichnet.
Das Verbot brachte einen Vorteil, den der Forscher anerkennt. Ohne einen Chatbot, auf den sie sich stützen konnten, diskutierten die Studierenden mehr miteinander und erarbeiteten den Text in echter Auseinandersetzung. Der Preis dafür war jedoch eine Obergrenze, wie weit diese Diskussion innerhalb des Zeitlimits gelangen konnte.
Unangeleitete KI-Nutzung: Flüssige Ausgaben, wenig Prüfung
Wenn die Ohne-KI-Gruppe unter zu wenigen Ideen litt, so litt die unangeleitete Gruppe unter zu wenig Skepsis. Die Studierenden in der mittleren Bedingung akzeptierten weitgehend, was ChatGPT vorschlug, und begründeten eine Änderung häufig damit, dass die Version der KI einfach „besser klang“. In einigen Fällen tauschten die Teilnehmenden Begriffe wie „shall“ und „individual“ gegen von der KI vorgeschlagene Alternativen aus, ohne irgendein Verständnis für die juristischen Konsequenzen dieser Ersetzung zu zeigen – eine Substitution, die beim Verfassen von Gesetzestexten erhebliches Gewicht hat.
Jede einzelne Untergruppe in dieser Bedingung behielt mindestens einen irreführenden oder juristisch überflüssigen Begriff aus der Ausgabe von ChatGPT bei. Das Problem war nicht, dass das Tool nutzlosen Text produzierte; es ist, dass der Text so poliert ankam, dass er kaum zum Hinterfragen einlud.
Strukturiertes Training erzeugte echten Dialog mit dem Tool
Die dritte Gruppe verhielt sich anders. Diese Studierenden setzten sich mit dem Modell auseinander, testeten alternative Formulierungen und hinterfragten die substanziellen juristischen Fragen unter der Aufgabe, statt den ersten plausiblen Entwurf zu akzeptieren. Ihre Ergebnisse spiegelten das wider: 2024 übertraf die geschulte Gruppe die beiden anderen deutlich, wobei sich der Vorteil am klarsten in der anspruchsvolleren Take-Home-Klausur zeigte.
Der Trainingsvorteil verschwand im zweiten Jahr fast
Dann verschob sich das Muster. Als das Experiment 2025 wiederholt wurde, war die Lücke fast geschlossen. Alle drei Gruppen erreichten ungefähr dasselbe Leistungsniveau, einschließlich der Studierenden, die überhaupt keinen Zugang zu KI hatten.
Schrepels Erklärung ist einfach: Vertrautheit. Als Chatbots ein normaler Teil des Alltags wurden, kamen die Studierenden bereits mit dem Wissen in den Hörsaal, wie man mit ihnen arbeitet. Formale Anleitung hatte noch Wert, verlieh aber nicht mehr denselben Vorteil wie ein Jahr zuvor, als das Tool weniger in die routinemäßige akademische Arbeit eingebettet war.
Dieser Befund erschwert jede einfache politische Lesart. Er legt nahe, dass der Nutzen von Training teilweise eine Funktion der Ausgangsfähigkeiten ist – wertvoll, wenn ein Tool neu ist, weniger differenzierend, sobald es allgegenwärtig wird.
Was Lehrende aus den Ergebnissen mitnehmen sollten
Aus dem zweijährigen Durchlauf ergeben sich mehrere praktische Beobachtungen:
- KI aus einer zeitlich begrenzten Übung zu entfernen, erhöhte die Qualität der studentischen Arbeit nicht; in diesem Kurs senkte sie sie.
- KI ohne Anleitung zuzulassen, machte die Studierenden anfällig für selbstsicher klingende Fehler, die zu erkennen ihnen die Expertise fehlte.
- Studierenden beizubringen, KI-Ausgaben zu hinterfragen – Konsistenz prüfen, Genauigkeit verifizieren, gezielt prompten –, führte messbar zu besseren Ergebnissen, zumindest solange die Fähigkeit noch ungewöhnlich war.
- Die Wissenslücke rund um KI-Kompetenz schließt sich von selbst, während Studierende alltägliche Erfahrung mit diesen Tools sammeln.
Die weiterreichende Lehre ist, dass die bedeutsame Unterscheidung möglicherweise nicht KI versus keine KI ist, sondern angeleitete versus unangeleitete Nutzung. Der Vorteil der geschulten Gruppe kam daher, den Chatbot als etwas zu behandeln, das man herausfordert, statt ihm zu gehorchen, und diese Gewohnheit, nicht das Tool selbst, scheint die Verbesserung der Ergebnisse bewirkt zu haben.
Es lohnt sich, den Umfang der Studie im Blick zu behalten. Die Befunde stammen aus einem einzigen Kurs, von einem einzigen Lehrenden und aus einer einzigen Disziplin, mit relativ bescheidenen Kohortengrößen. Juristisches Verfassen ist zudem ein Bereich, in dem Präzision auf eine Weise zählt, die sich möglicherweise nicht sauber auf andere Fächer übertragen lässt.
Dennoch verleiht der zweijährige Verlauf den Ergebnissen ungewöhnliches Gewicht. Schrepel ging davon aus, dass unangeleitete KI nach hinten losgehen würde, und die Daten weigerten sich, dieser Erwartung zu folgen. Seine Schlussfolgerung ist eine nützliche Korrektur für Institutionen, die ein vollständiges Verbot abwägen: Das Verbot beseitigte eine Ideenquelle, ohne das Bedürfnis nach Urteilsvermögen zu beseitigen, während die Anleitung zur verantwortungsvollen Nutzung des Tools den größten messbaren Gewinn brachte.
Dieser Artikel basiert auf einer Reportage von The Decoder. Lesen Sie den Originalartikel.
Originally published on the-decoder.com





