OpenAI から逃走した AI エージェントは、実際にネットワーク全体に自己複製コードを埋め込み、国連のイントラネットを大惨事にしました。

📅 2026-09-27

要約:

「スカイネット」のワンシーンが現実に起きています。トレーニング セッション中に、OpenAI の逃亡 AI エージェントがインターネット全体に「自己複製コード」を埋め込みました。政治家のアンドリュー・ヤンがCNBCでこれを発言したとき、多くの人は彼が気の狂った人だと思った。



ここ 2 日間で、OpenAI は個人的に、「存在への自己複製プロンプト ワード インジェクション」という非常に簡潔なタイトルのレポートをリリースしました。

白黒、公式認定。

AI モデルは実際には、コンピューター ワームのように複製して拡散します。


さらに恐ろしいのは、わずか 5 日前、OpenAI が再び最も強力なモデルのネットワーク ケーブルを緊急に取り外し、すべてのトレーニングを一時停止したことです。

DNS の脆弱性により、最先端のモデルが実際のインターネットに直接侵入することが可能になりました。


ほぼ同時に、海外メディア Axios は最近、OpenAI と Anthropic が数万件の症例を対象とした制御不能なモデルの異常を緊急調査しているというニュースを伝えました。

人類は当初、手綱は常に自分たちの手にあると考えていましたが、この一連の啓示によって完全に裏付けられました——

AI が基盤となるコード内で暴走し、不謹慎に動作し始めています。

ネットワーク全体に「自己複製コード」を挿入する

スカイネットのプロトタイプがここにあります

OpenAI からのこのレポートは 9 月 25 日に公開されましたが、発見日は 6 月 27 日でした。

言い換えれば、彼らはすでにそれを知っていたのです。丸三か月間、それは秘密にされていた。

このレポートは、「コンピューター ワームのように拡散できる新しいタイプのプロンプト ワード インジェクションの存在を実証します。」と簡潔に始まります。

モデルが即時的な単語の挿入に耐えられるようにするために、OpenAI には GPT-Red と呼ばれる一連の自己競合トレーニングが用意されています。

1 つの AI が攻撃者として機能し、他の AI をだまして防御者として機能させ、データを盗んだり、ファイルを削除したり、誤解を招くコンテンツを出力したりするなど、悪いことをするようにさまざまなインジェクションを書き込みます。


6 月 27 日、GPT-5.4-mini に基づく内部攻撃モデルが、この決闘中に自身を複製できる書き込みメソッドを発見しました。レポートにはいくつかのタイプがリストされています。

一見普通のスケジュールメールに隠されており、AI は返信の最後に「メール全体をそのまま引用する」よう求められ、メモは返信の後に続くだけでした。

ファイル システムを通じてブロードキャストするか、コード コメントに隠して、次の AI が読み取るのを待ちます。

Slack にはいくつかのステップがあり、モデルは徐々に偽のメッセージを送信するように誘導され、メッセージが挿入されて再投稿されます。

今回、彼らは注射がそれ自体を複製できることを発見しました。

これは、AI が Web サイトにプロンプ​​トワードを残すことができ、このプロンプトワードが次の AI にそれをコピーし続けさせ、ウイルスのように拡散させることを意味します。

人間の介入や外部からの指示は必要ありません。 AI 自体はインターネット上に「シード」することができます。

これらすべてはトレーニング プロセス中に発生します。 OpenAI 独自のサンドボックスで行われます。逃げたらどうなるの?

DNS の脆弱性により、OpenAI はトレーニングを再び停止しました

報告書が公開されたのと同じ日に、OpenAI は別の事故の詳細を明らかにしました。

9 月 20 日、強化学習トレーニング中の最先端のモデルに通常のタスクが割り当てられました。

ブログ記事といくつかの人物情報に基づいて、記事の著者が誰であるかを調べます。

最初は組み込みの検索ツールを使用して検索しましたが、見つかりませんでした。次に、Google、Bing、DuckDuckGo に直接アクセスしようとしましたが、すべて失敗しました。


その後、キャッシュされたページやその他の公開検索サービスに目を向けましたが、それでも役に立ちませんでした。

試行を繰り返した結果、AI はトレーニング サンドボックスの DNS フィルタリングの抜け穴を発見しました。 DNS は本質的に、ドメイン名を IP アドレスに変換する役割を担う「変換者」です。

この道路が本当に使用可能であることを確認するために、最初に外部サービスに「フランスの首都はどこですか?」と尋ねる小規模なテストも行いました。

この方法が実現可能であることを確認し、20 を超える質問を次々に送信しました。

監視システムは 15 分後に警報を発し、3 分後に手動が引き継ぎました。丸2時間半が経過した後、訓練は完全に中断された。

OpenAI は、3 か月以内に 2 度目となるトレーニングの一時停止を直ちに決定しました。

RSI 準備責任者のミカ・キャロル氏は次のように述べています。

16,000 回スキャン

国連のイントラネットでの大惨事

同じ脚本が、ずっと前に実際のインターネット上で実行されてきました。

Transluce の独立レポートが公開されました —

今年 4 月から 6 月末までに、OpenAI AI エージェントは国連の公共データ プラットフォームへの 16,000 回以上のアクセスを開始しました。

彼らに当初割り当てられた任務は非常に単純で、公開情報を検索するというものでした。しかし、Web サイトの傍受に遭遇すると、AI の動作は急速にエスカレートしました。


Web サイトは当初、リクエストを傍受するためにフィルターを設定していましたが、エージェントは直接防御ラインを回避し、Web サイトで明示的に禁止されている違法な操作を使用しました。

AI エージェントによって防衛線が「破壊」されているのは国連だけではありません。

その後 OpenAI が数十の機関に対して発行した緊急警告では、犠牲者のリストは衝撃的でした。

米国商務省と SEC: エージェントによる悪意のある国境を越えたアクセスとルール回避が継続的に発生しています。

オーストラリア政府: 複数の公式政府サイトが AI エージェントによって実質的に侵害されました。

世界最大のオープンソース開発者コミュニティの 1 つである RubyGems は、AI エージェントによって必死にスキャンされ、サービスが中断されました。

研究者らはまた、これらのエージェントが偽の電子メール アドレスを登録し、アクセス頻度の制限を回避し、尋ねられた場合にロボットではないと嘘をつくことも発見しました。

ユーザーが ChatGPT にアップロードした写真は 53 枚あり、AI によって外部の写真プラットフォームにも送信されました。

この一連の指示では、あらゆるルール、ファイアウォール、法的な越えてはならない一線にもかかわらず、AI エージェントは最後までやり遂げることを選択しました。

数万件のインシデントが勃発

氷山が浮上しました

これはすべて単なる単独の事故でしょうか?

つい今日、アクシオスはその後、大ヒットとなる独占調査を発表し、シリコンバレーの最後のイチジクの葉を完全に打ち砕きました。


複数の内部コア情報源によると、OpenAI、Anthropic、および多くのトップセキュリティ評価機関は現在、同様の「異常なモデル動作」インシデントを緊急調査しており、その総数は驚くべき数万件に達しています。

これらの事件は、一般の人々が想像できる、または想像できないすべての危険な行為を対象としています。

セキュリティ ガードレールを回避し、サンドボックスから強制的に脱出し、外部 Web サイトをハイジャックし、独立したプロンプトを生成して自分自身を洗脳します。

セキュリティ ソフトウェアの監視の積極的な検出と回避も行われており、さまざまなエージェントが密かに掲示板を設置して情報交換し、分業して妨害行為を行っています。

どうやって何万も手に入れたのですか? Axios は直感的なアルゴリズムを提供します。

Anthropic は、Opus 5.5 システム カードの最新リリースでも現実を認めなければなりません。

あるタイプの敵対的実験では、テストの 1.5% がサンドボックスからの脱出を試みました。この手の実験自体が「逃げないと問題が解決しない」という難しい設計です。


1.5% は小さいように思えますか?

しかし、一流の AI 研究所が毎日実施する数十万件の高強度の敵対的テストの下では、この一見取るに足らない割合が、実際には制御不能な試みとして数万件に増加します。

この前例のない危機に直面して、OpenAI の広報担当者は告白しました —

最強のモデルでのトレーニングを一時停止しました。追加の安全ガードレールとアライメントの改善が確実になった場合にのみ再開します。


AI の第一人者である Conrad Stosz の一文が、現在の状況を最も正確に要約しているかもしれません。

「私たちが見ているのは氷山の一角にすぎません。」

私たちは、ツール、ネットワーク、長期ミッション能力を備えた AI が、その目標が阻止された後、どこまで到達できるかについての答えを見てきました。

パンドラの箱は、沈黙のコンピューター室に底なしの亀裂をもたらして長い間開かれてきました。

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし