架空の専門家が現実の痕跡をネット上に残している
新たなプレプリントが、生成AIの奇妙な副作用に警鐘を鳴らしている。言語モデルが同じ架空の身元を何度も繰り返し生成するため、それらが学術記録やオンライン記録の一部を汚染し始めているというのだ。2026年8月27日に公開された報道によると、Elena VasquezやMarcus Chenといった名前が、何百ものAI生成の論文、記事、書籍に登場しているが、いずれも実在の人物ではない。
この論文の著者は、Samsungとワルシャワ大学の研究者で、こうした反復する身元を一種のAIの「取り憑き」と表現している。彼らの中心的な主張は、大規模言語モデルが名前を捏造するのは想定内だということではなく、似たような文脈では同じ名前を何度も捏造する傾向があるという点にある。時間がたつにつれ、その反復は検索結果、リポジトリ、そして一見まともに見える出版物に、偽の権威を注ぎ込むことになる。
名前は信頼を運ぶからこそ、この問題は重要だ。学術出版や研究コミュニケーションでは、読者は著者名、所属機関での役割、専門分野を手がかりに信頼性を判断することが多い。AIシステムがもっともらしい専門家名を繰り返し生成し、それらが正式文書のように見えるものへ紛れ込めば、捏造コンテンツと本物の学術記録との境界は、はるかに薄くなる。
繰り返される名前のパターンはどう生まれるのか
論文は、著者らが「相関する名前の事前分布」と呼ぶものに焦点を当てている。平たく言えば、いくつかのモデルは架空の人物をランダムに生成しているわけではない。特定の種類の専門家、著者、登場人物を求められると、ある名前に偏るように見える。報道ではいくつかの例が挙げられており、Elena Vasquez、Marcus Chen、Elara Voss、Aris Thorne、Lena Petrova、Elena Amara Okaforなどは、モデルやプロンプトの文脈によって異常な頻度で現れるとされる。
この現象は単独の名前にとどまらない。研究者によれば、モデルは「相関するキャラクターの集合」も生成しており、ある名前は一緒に現れやすいという。つまり、モデルは単なる個別のラベルを繰り返しているだけでなく、身元パターンの塊そのものを再生産している可能性がある。そうなると、偽の著者表記はより大規模に展開しやすくなる。学術風の文章、書籍、伝記、ウェブサイトを生成する利用者は、同じような権威ある顔ぶれの架空人物を何度も受け取ることになる。
問題をより深刻にしているのは持続性だ。AI出力の一つに現れた偽の専門家は、それ単体では取るに足らないかもしれない。しかし同じ身元がリポジトリ、ウェブサイト、文書のあちこちに再登場すれば、デジタル上の足跡を蓄積してしまう。すると検索エンジンや引用システムがその錯覚を増幅し、読者にとって、その情報源が捏造なのか、それとも単に見つけにくいだけなのかを見分けるのが難しくなる。
モデルの癖から出版の問題へ
この記事は、このパターンを学術出版のインフラに直接結びつけている。研究者たちは、モデルが頻繁に出力することを知っていた名前をデータベースで検索し、その名前が広範なAI生成コンテンツに埋め込まれているのを見つけたという。最も印象的な例の一つとして挙げられているのが、CERNが運営し、実際のDataCite DOIを発行するZenodoだ。チームは、ゴースト著者に帰せられ、存在しないジャーナルと偽造された発行日に結びつけられた記録を1,655件特定したとしている。
この点が重要なのは、DOIが学術コミュニケーションにおける最も強い正当性のシグナルの一つだからだ。品質を保証するものではないが、その記録が組織化された出版・索引のエコシステムに入ったことを示す。偽造されたジャーナル、日付、著者が実在のDOIインフラの上に乗ることができるなら、信頼の失敗はもはやスパムブログや低品質なコンテンツ農場に閉じない。研究者、司書、機関が使うシステムそのものに及び始める。

この記事はまた、このパターンを、AI生成の「研究」が人間の成果のように売られていた以前の報道とも結びつけている。引用されているある事例では、医療研究を提供する会社が、存在しない創業者兼主任方法論担当者として Elena Vasquez という名前を掲載していた。報道後、その名前は会社のサイトから削除されたとされる。別の例では、Facebook上で流布した偽の声明が、存在しない「エグゼクティブ・ディレクターの Elena Vasquez 博士」に帰せられていた。
これらを総合すると、問題は純粋に学術的なものではない。同じ捏造された身元が、健康に関する主張、SNS上の噂、商業サービス、出版プラットフォームの間を移動していくのだ。この横断的な拡散こそが、この現象に広い意味を与えている。
汚染リスクが高まっている理由
生成AIは、説得力のあるテキストを大規模に作るコストを下げる。論文、レポート、ウェブページ、そして機関向けフォーマットを模倣できる書籍風の文書もその対象だ。モデルが少数の説得力ある架空の名前を使い回す傾向まであるなら、悪意ある者は毎回新しい人格を捏造する必要すらない。モデルが、すでに信用できそうに聞こえる反復的な身元を供給することで、その作業の一部を肩代わりするからだ。
危険は意図的な詐欺に限られない。とくに急いで下書きを作るときなど、生成された名前を細かく確認しない利用者もいるだろう。自動化または半自動化された出版フローでは、実在確認が行われないまま、偽の専門家が公的記録に紛れ込む可能性がある。一度公開されれば、その身元は引用、収集、索引付けされ、別の場所で再利用されうる。
こうしてフィードバックループが生まれる。モデルによる反復がウェブ上での反復を生み、ウェブ上での反復が、将来のモデルが目にする内容をさらに強化する。やがて、検索ではなく直接確認に頼らない人にとって、モデルの産物と記録された実在人との区別は曖昧になっていく。
研究システムにとっての真正性の課題
報道は完全な解決策を提示していないが、真正性の問題の規模を軽視しにくくしている。学術出版は長年、剽窃、ペーパーミル、偽の査読に対処してきた。AIのゴースト著者は、そこに別種の失敗を持ち込む。人間による帰属を前提に作られたシステムの中で、合成された身元が汚染を起こすのだ。
この課題は、リポジトリ、編集者、出版社、索引サービス、検索プラットフォームにまたがる。より強力な著者確認、捏造ジャーナルのよりよいスクリーニング、そして疑わしいほど反復的な身元パターンへのより厳しい監視が必要になるかもしれない。大きなポイントは、AIの悪用が単に「テキストが機械生成かどうか」だけの問題ではないことだ。そのテキストに結びつけられた人物が本当に存在するかどうかでもある。
このプレプリントの知見が響きを持つのは、それが微妙でありながら構造的に重要な変化を描いているからだ。言語モデルは、もはや不完全な文章や捏造された引用を生成するだけではない。偽の専門家を標準化し、それを静かに知識エコシステムへ差し込んでいる可能性がある。この流れが制御されなければ、誤りがあまりに普通に見えるがゆえに、学術記録はかえって監査しにくくなるだろう。
この記事は404 Mediaの報道に基づいています。元記事を読む。
Originally published on 404media.co





