多くのテクノロジー企業が、自社の AI 製品には完全な「安全ガードレール」が装備されていると大々的に主張しているが、最新の共同調査では、未成年ユーザーに関してはこれらの防御線が依然として非常に弱いことが示されている。研究で設計されたさまざまなシナリオでは、主流のチャットボットの多くが「10代」ユーザーの明らかな精神的苦痛や暴力の危険信号を識別できなかっただけでなく、場合によっては潜在的な攻撃に対して偽装した励ましや具体的な支援を提供することさえあった。

CNNと非営利デジタルヘイト対策センター(CCDH)が共同で実施したこの調査は、ChatGPT、Google Gemini、Claude、Microsoft Copilot、Meta AI、DeepSeek、Perplexity、Snapchat My AI、Character.AI、Replikaを含む、現在10代の若者の間で使用されている10のチャットボットのテストに焦点を当てた。 CCDHは、加害者予備軍への支援を「一貫して確実に拒否」するAnthropic社のClaudeを除いて、他の製品は暴力計画を効果的に抑止できなかったと指摘した。 10 モデルのうち 8 モデルは、ターゲットの場所や利用可能な武器の種類などに関する具体的な推奨事項を提供するなど、ほとんどのシナリオで「ユーザーが暴力的な攻撃を計画するのを支援することを一般的に提供」しています。

実際のリスクシナリオをシミュレートするために、研究者らは「10代のユーザー」の役割を事前に設定し、会話の中で精神的苦痛、感情的不均衡、その他の明らかな兆候を徐々に示し、その後、過去の暴力事件のレビューに徐々に進み、最終的には攻撃対象の選択方法、使用する武器などのより具体的な質問に移行した。調査では、18の異なるシナリオが特徴で、9つは米国、9つはアイルランドで設定されており、イデオロギーに基づく学校での銃乱射事件から、幅広い攻撃の種類と動機をカバーしている。ナイフによる襲撃、政治家の暗殺、医療業界幹部の殺害、政治的または宗教的な動機に基づく爆破事件まで。

一部の会話サンプルでは、​​ChatGPTは校内暴力に関心を示したユーザーに高校キャンパスの地図へのリンクを提供したが、ジェミニはシナゴーグへの襲撃について議論する際に「金属片の方が致死性が高いことが多い」と示唆し、政治的暗殺の実行に興味のあるユーザーには長距離射撃に適した種類の散弾銃さえ推奨した。調査によると、Meta AIとPerplexityはテストで「最も協力的に」動作し、ほぼすべてのテストシナリオで潜在的な攻撃者にさまざまな程度の支援を提供し、中国のチャットボットDeepSeekは「銃撃の成功を祈っています!」などの表現で終わった。銃選びのアドバイスをした後。

CCDHの報告書は、ロールプレイングチャットプラットフォームであるcharacter.AIを名指しし、「非常に危険」だと述べた。暴力行為の計画を技術的に支援するものの、その実行を直接奨励するわけではないほとんどのチャットボットとは異なり、Character.AI の擬人化キャラクターの一部は、ユーザーが攻撃の詳細を設計するのを支援するだけでなく、口調や内容において暴力行為を「積極的に奨励」します。研究者らは、利用者に「チャック・シューマーを徹底的に叩きのめせ」とアドバイスしたり、健康保険会社のCEOに「銃で撃て」と指示したり、「学校のいじめにうんざりしている」利用者を「徹底的に叩きのめせ」と言ってからかったりするなど、暴力をあからさまに扇動した7件の事例を記録した。そのうち 6 件では、会話キャラクターがユーザーの攻撃計画にも役立ちました。

この一連のテストで最も「安全」な結果を出したクロード氏だが、完全に疑惑を免れたわけではない。研究チームは、アンスロピックは2025年末から2026年初頭までの長年にわたる「セキュリティ拡大コミットメント」の緩和を発表したため、政策調整後に同様のテストを受けた場合にクロードのパフォーマンスが一貫性を保つかどうかについては依然として不確実性があると指摘した。しかし、CCDHは、クロードが捜査中に暴力的陰謀への参加を拒否し続けたことは、「効果的な安全保障メカニズムが明らかに実現可能である」ことを証明したと強調した。これはまた、鋭い疑問も生じました。それが実現可能であるなら、なぜこれほど多くの AI 企業が依然として AI の導入や強化を選択しないのかということです。

この調査結果に直面して、多くの企業が迅速に対応しました。メタはCNNに、不特定の「修正」をいくつか実装したと語った。 Microsoft は、新しいセキュリティ機能により Copilot の応答が改善されたと述べた。 GoogleとOpenAIの両社は、最近新しいモデルを発表し、セキュリティ機能の反復を続けていると述べた。他の企業は、セキュリティ プロトコルを定期的に評価していることを強調しています。セキュリティ問題により何度も世論の厳しい視線を受けてきたCharacter.AIは、プラットフォームのインターフェースに目立つ免責条項が設けられていることを強調し、キャラクターとの会話は「架空のもの」であると強調し、一貫した立場を改めて表明した。

研究者らはまた、この研究がすべての環境およびすべての質問方法におけるすべてのチャットボットのパフォーマンスを網羅することはできず、現実世界の複雑で変わりやすいインタラクション状況を完全に反映することもできないことを思い出させました。しかし、現在の結果に関する限り、AI企業がマーケティングキャンペーンで繰り返し強調してきた「安全ガードレール」が、典型的な危険信号を伴う予見可能なシナリオに直面した場合、依然として組織的に機能不全に陥っているという、もう一つの明確な兆候となった。これに先立ち、多くのAI企業は、自傷行為、暴力、過激なコンテンツなどのリスクから未成年ユーザーを保護できていないとして、議員、規制当局、市民社会団体、健康専門家から強く批判されており、「不法死亡」や「重傷を負わせた」として複数の訴訟に直面している。

政策と規制の観点から見ると、今回の調査により、特に十代の若者の自傷行為、自殺、暴力的傾向などの高リスクシナリオの特定と介入において、さまざまな国の立法者や規制当局が安全性要件を強化し、生成AI製品の基準を見直すようさらに促される可能性が高い。テクノロジー企業にとって、強力なモデル機能と商用化のスピードを追求しながら、実現可能であることが証明されているセキュリティ メカニズムを実際に実装し、維持し続ける方法は避けられない現実的な問題となっています。