アムステルダム自由大学で「AIの法」コースを設計したティボー・シュレペルは、教室に一般的な前提を持ち込んでいた。それは、学生に何の指示もなくAIチャットボットを渡せば、おそらく害の方が大きいというものだった。2年間の統制されたテストは、彼を正反対の結論へと導いた。彼自身の言葉を借りれば、「私は間違っていた」。
彼が行った実験は、見出しよりもその構造において注目に値する。学生にAIに対する態度を調査するのではなく、シュレペルは異なるルールを与えたグループに学生を分け、実際に何を生み出したかを測定した。同じ設定が2回実施された——まず2024年に66人の学生で、次に2025年に164人の参加者で——これにより、AIが役立ったかどうかだけでなく、その導入方法が時間の経過とともに重要だったかどうかを観察することができた。
3グループ実験の仕組み
すべての参加者が同じ核心的課題に直面した。4人か5人の小チームで作業し、EU AI法のある条項を20分で改善するというものだった。提出物は実質性、明確さ、比例性、革新性で採点された——表面的な磨き上げではなく、真の法的推論を評価する基準である。すべての学生は同じ評価も受けた。多肢選択式試験と、規制の別の条項を修正するよう求める持ち帰り試験である。
唯一の変数は、どのように作業を許可されたかだった。
- AIなし:このグループはChatGPTの使用を完全に禁止され、議論と自身の法的知識に頼らなければならなかった。
- ガイドなしのAI:これらのチームはChatGPTが生成した修正提案をテキストに直接埋め込まれた形で受け取った。ツールを使い続けることはできたが、プロンプトの方法や返答の評価方法を誰も説明しなかった。
- トレーニング済みAI:このグループは法的プロンプトエンジニアリングの実践的指導を受け、AI出力の一貫性と正確性を確認する明示的なトレーニングも受けた。
AIなしグループは「アイデア枯渇」という壁にぶつかった
AIなしで作業した学生は、研究の両年で最下位だった。彼らの編集は表面的なものに偏っていた。明確さのために文を言い換え、冗長性を削り、文言を引き締めるといったものだ。条項に対する実質的な法的改善を試みたサブグループは少数にとどまった。より印象的だったのはタイミングである。およそ10分から15分後、多くのチームは試すことを尽かしてしまった——シュレペルが「アイデア枯渇」と名付けたパターンである。
禁止措置は研究者も認める1つの利点を生んだ。頼るチャットボットがなければ、学生同士の議論が増え、真正の議論を通じてテキストを練り上げた。しかしその代償は、時間制限内でその議論が到達できる範囲の天井だった。
ガイドなしのAI利用:流暢な出力、ほとんど吟味されず
AIなしグループがアイデアの少なさに苦しんだとすれば、ガイドなしグループは懐疑心の少なさに苦しんだ。中間条件の学生はChatGPTの提案をほぼそのまま受け入れ、AIのバージョンが単に「より良く聞こえる」という理由で変更を正当化することが頻繁にあった。場合によっては、参加者は「shall」や「individual」といった用語をAIが提案した代替語に置き換え、そうすることの法的帰結を把握している様子を一切示さなかった——法令起草において実際に重みを持つ置き換えである。
この条件のすべてのサブグループが、ChatGPTの出力から少なくとも1つの誤解を招く用語または法的に無関係な用語を保持していた。問題は、ツールが役に立たないテキストを生成したことではなく、そのテキストがあまりに洗練されて届き、疑問を抱くことを妨げたことである。
構造化されたトレーニングはツールとの真の対話を生んだ
第3のグループは異なる行動をとった。これらの学生はモデルに反論し、代替の言い回しを試し、最初のもっともらしい草案を受け入れるのではなく、課題の根底にある実質的な法的問題を問いただした。そのスコアはそれを反映していた。2024年、トレーニング済みグループは他の2グループを大差で上回り、その優位性はより要求の厳しい持ち帰り試験で最も明確に現れた。
トレーニングの優位性は2年目にほぼ消えた
そしてパターンは変わった。2025年に実験が繰り返されたとき、その差はほとんどなくなっていた。3グループすべてがほぼ同じパフォーマンス水準に達し、AIにまったくアクセスできなかった学生も含まれていた。
シュレペルの説明は単純である。馴染み深さだ。チャットボットが日常生活の普通の一部になるにつれ、学生はすでにそれらを使いこなす方法を知った状態で教室に来るようになった。正式な指導には依然として価値があったが、ツールが日常的な学業にそれほど浸透していなかった1年前ほど同じ優位性をもたらすことはもはやなかった。
この発見は、単純な政策的解釈を複雑にする。トレーニングの利益は部分的にベースラインスキルの関数であることを示唆している——ツールが目新しいときは価値があり、それが当たり前になると差別化要因ではなくなる。
教育者が結果から学ぶべきこと
2年間の実施からいくつかの実践的所見が浮かび上がる。
- 時間制限のある演習からAIを排除しても学生の作業の質は上がらなかった。このコースでは、むしろ下げた。
- 指示なしでAIを許可すると、学生は見抜く専門知識を欠いたまま、自信ありげに聞こえる誤りに対して脆弱になった。
- AI出力を問いただすこと——一貫性の確認、正確性の検証、意図的なプロンプト——を学生に教えることは、少なくともそのスキルが珍しかった間は、測定可能なほど良い結果を生んだ。
- AIリテラシーをめぐる知識の差は、学生がこれらのツールに日常的に接する経験を積むにつれて、自然に縮まっている。
より広い教訓は、意味のある区別はAI対AIなしではなく、ガイドあり対ガイドなしの使用かもしれないということだ。トレーニング済みグループの優位性は、チャットボットを従うべきものではなく挑戦すべきものとして扱うことから生まれ、その習慣こそが、ツール自体ではなく、成果の改善を促したように見える。
研究の範囲を視野に入れておく価値がある。知見は単一のコース、単一の講師、1つの学問分野から得られたもので、コホート規模も比較的控えめである。法的起草はまた、他の科目にきれいに当てはまらないかもしれない形で正確性が重要となる領域でもある。
それでも、2年間の軌跡はこの結果に異例の重みを与える。シュレペルはガイドなしのAIが裏目に出ると予想して始めたが、データはその予想に協力することを拒んだ。彼の結論は、全面禁止を検討している機関にとって有用な修正である。禁止は判断の必要性を排除することなくアイデアの源を奪い、一方でツールを責任を持って使う方法の指導が最大の測定可能な利益をもたらした。
この記事はThe Decoderの報道に基づいています。元の記事を読む。
Originally published on the-decoder.com







