xAI、Grokの学習データをめぐり新たな法的課題に直面
xAIは新たな訴訟で、Grokの画像および動画機能に関連するデータに、児童性的虐待素材、いわゆるCSAMを使用したと非難されている。Ars Technicaが2026年8月27日に報じたこの訴状は、Jane Doeと特定された原告を中心にしており、彼女は自身の虐待画像が何年も前にオンラインで流通し、その後、既知の違法素材を識別するために使われるシステムの一部になったと述べている。
元記事によれば、訴状はxAIが原告を描いたAI生成CSAMの作成を可能にしただけでなく、それらの出力を保存し、さらにGrokの再学習に使ったと主張している。この主張が立証されれば、違法または極めて有害な素材が学習パイプライン、モデル出力、あるいはその両方に入り込むリスクをAI企業がどう扱うかを問う重要な試金石になる可能性がある。
訴状の主張
原告は、2000年代初頭に就学前の子どもだった頃に虐待を受け、その虐待画像がオンラインで売買されたと述べている。Ars Technicaは、それらの画像が後にNational Center for Missing and Exploited ChildrenやCanadian Centre for Child Protectionなどの組織によってハッシュ化され、デジタルシステム全体で既知の素材を識別する手段になったと報じた。
訴状によれば、原告は後にCanadian Centre for Child Protectionから、xAI上のAI生成CSAMに自分が描かれていると通知を受けたという。報道によると、その通知は彼女に再びトラウマを与え、AIツールが既知の被害者に結びつく新しい合成変種を生成することで、古い虐待素材の寿命を延ばしているのではないかという新たな恐怖を生んだ。
この訴訟は、出力そのものの害だけを主張しているわけではない。xAIが元の虐待画像と、より新しいAI生成版の両方をGrokの継続的な学習プロセスに使ったと主張している。Ars Technicaは、xAIがCSAMで学習したと明示的に非難されたのはこれが初めてであり、訴状自体はその学習データに関する主張の根拠について詳細をあまり示していないと指摘した。
出力、保存、モデル開発をめぐる القضية
この訴状の法的重要性は、Grokが虐待的な画像を生成したとされる点だけではない。より大きな主張は、同じシステムがそうした素材をモデル開発に組み込んでいた可能性があるということだ。この違いは重要である。AI企業はすでに、学習データをどう調達するか、有害コンテンツをどうふるい分けるか、そして問題のある出力を後の製品改善のために保持するのかで圧力を受けている。
本件では、原告はxAIが加害者による新たな搾取画像の作成を容易にし、さらにその出力が保存され再利用されたのであれば被害を増幅させたと主張している。これはコンテンツモデレーションだけでなく、データガバナンスと生成後の取り扱いに対する挑戦でもある。
Ars Technicaの記事によると、訴状にはオンライン掲示板の投稿が引用されており、そこでは加害者が原告や他の既知の被害者を題材にしたAI生成CSAMの作成について話し合っていたという。提示された原文に基づけば、この主張は、原告がこの問題を単なる一般的な安全性の失敗以上のものと見る理由を説明している。懸念は、生成システムを通じた標的型で反復的な被害である。
わかっていることと、わかっていないこと
元資料は、学習データに関する主張の不確実性を慎重に指摘している。Ars Technicaによれば、xAIが、以前報じられた論争のあるデータセットを学習に使った形跡はなく、その後研究者がCSAMの存在を見つけて削除したという。記事はまた、xAIが原告の虐待画像で学習したという主張について、訴状が詳細をあまり述べていないと伝えている。
そのため、告発の重大さと、記事で公開されている証拠の間にはギャップがある。それでも訴状は、原告の画像がNCMECが管理するCSAMハッシュリストに含まれていたこと、そして原告側弁護士がその同じ素材がGrokの画像・動画生成能力を構築するためのデータセットの一部だったと主張していることに、この主張を結び付けているとされる。
現時点では、これらは提出された訴状における主張であり、裁判所の認定ではない。ただし、判決が出る前であっても、この事件は、AIモデル開発者が違法素材の学習コーパスへの混入、出力での再出現、フィードバックループによる再取り込みを防ぐのに十分な管理を持っているのかという監視を強める。
xAIを超えて意味するもの
この訴状は、規制当局、裁判所、法執行機関がすでに、生成AIシステムが搾取的な素材の作成にどう使われうるかを調査している最中に出された。さらにこの件は、モデル開発者にとって特に難しい問題を浮き彫りにする。システムが派生的な虐待コンテンツを生成できるようになると、被害はもはや元のデータセットに何が含まれていたかだけに依存しなくなる。合成的な複製によって拡大しうるのだ。
それは業界にいくつかの実務的な問いを投げかける。
- 企業は学習データセットをどのようにして既知の違法素材から選別するのか。
- 生成された出力は保持、レビュー、あるいはモデル改善に再利用されるのか。
- ハッシュ、被害者報告、監視団体の警告で虐待コンテンツが特定されたとき、プラットフォームはどう対応するのか。
- 保護策は、既知の人物に対する標的型の合成被害を止めるよう設計されているのか。
これらの問題は一社や一つのモデル群だけに固有のものではない。しかしxAIの訴訟は、歴史的な虐待素材、AI生成の派生物、そして再学習の疑いを一つの被害連鎖として結び付けることで、異例に明確な形でそれらを示している。
今後の見通し
当面の次の段階は、法的・手続き的なものになる可能性が高い。xAIには主張に反論する機会があり、裁判手続きによってどれだけの証拠が公になるかが決まる。提示された原文に基づけば、この訴状はxAIが法廷でGrokをCSAMで学習させたと具体的に訴えられた初めての事例である。
より広いAI業界にとって、この事件は、コンテンツ安全性の議論が仮説上の悪用シナリオを超えつつあることを示す、さらなる兆候だ。議論はますます、運用記録、データの来歴、そして企業が禁止素材を公開出力だけでなく内部開発ワークフローからも排除していたことを証明できるかどうかをめぐる争いになっている。
もしこれらの主張が法廷で事実に裏付けられれば、その影響は評判の悪化にとどまらない。データセット監査、出力保存、被害者通知、そして生成AIシステムにおける法的責任の将来基準を形作る可能性がある。
この記事はArs Technicaの報道に基づいています。原文を読む。
Originally published on arstechnica.com







