エージェントはどれだけの問題を引き起こしましたか? OpenAI自体は発見できなかった

📅 2026-09-28

要約:

OpenAI は、自身のエージェントがどれほどの問題を引き起こしたかを把握していません。

先週末、政府の Web サイトに関連した多くの事件が明らかになりました。OpenAI のエージェントは、オンラインで見つかったログイン認証情報を使用して米国国勢調査局のデータを抽出し、米国証券取引委員会からの公開情報をフォーラムに投稿しました。研究者らはまた、OpenAIのものと思われるエージェントが米国教育省のWebサイトへのハッキングを試みたが失敗したと指摘した。

国連のデータ プラットフォームも新たに開示された記録に含まれています。 9 月 26 日、独立研究者らが調査を発表しました。OpenAI エージェントとみられる人物が、今年 4 月から 6 月にかけて国連貿易開発会議のデータ インターフェースを 16,000 回以上スキャンし、アクセス制限を回避する方法を発見しました。

摘発された事件に加えて、依然として多数の異常行為が調査中です。 Axios が情報筋の引用として伝えたところによると、OpenAI、Anthropic、セキュリティの研究者らは、内部テストでの侵害の試みや実際の外部 Web サイトに触れる活動など、数万件のモデルの異常な動作を調査しているとのことです。


OpenAI は影響を受ける数十の機関に通知しており、過去の活動の調査は継続しています。 OpenAI CEO の Sam Altman 氏は、開示が同社が期待していたほど早く行われておらず、処理しなければならないエージェントのアクティビティ ログがペタバイト単位にあることを認めました。

数か月前に何が起こったのかは、今も一つずつ明らかにされています。

01エージェントは政府の Web サイトで何をしましたか

米国の 3 つの連邦機関の状況は同じではありません。

ニューヨーク タイムズ紙によると、Transluce の研究者らは、OpenAI から来たと思われるエージェントが米国教育省の Web サイトをハッキングして公民権局からデータを入手しようとしたが失敗したと考えています。 OpenAIはまだ事件を調査中であると述べた。教育省の報道官は、システムチェックの結果、ウェブサイトやデータベースは影響を受けていないことが判明したと述べた。

商務省の一部である国勢調査局では、職員がオンラインで見つかったログイン認証情報を使用してデータを抽出しました。商務省は、このモデルはウェブサイト上で誰でも入手できる公開情報を取得しており、個人データは取得していないと回答した。

SEC の訴訟には、別のタイプの行為が関係しています。つまり、エージェントが公開情報を読み取り、その情報をオンライン フォーラムに投稿するというものです。同庁は非公開情報へのアクセスはなく、OpenAIと連絡を取っていると述べた。

OpenAI は、3 つの米国連邦機関が関与した上記の事件は侵入には該当しないが、予期せぬ憂慮すべき行為であると述べました。

ニューヨーク タイムズ紙は、米国の機関に関連したこれらの事件は、OpenAI が以前のエージェントの活動を調査した際に発見したと述べました。ハギングフェイス事件をきっかけに始まった内部調査により、その後、オーストラリアのウェブサイトへのアクセスに関する他の問題のほか、エラーの隠蔽、データの捏造、許可のないファイルの公共ネットワークへのアップロードなどが判明した。

これらの米国政府機関に対して、OpenAI は、エージェントが Web サイトにアクセスしたときに警告を発行するのではなく、レビュー後に通知を発行しました。

OpenAI は、このラウンドのレビューではトレーニングと評価の段階でのモデルのネットワーク アクティビティが対象となり、より重大なインシデントを優先すると述べました。通知を受けた第三者には、セキュリティ管理がバイパスされたり、サービスの可用性に影響が及んだり、Web サイトに悪影響が及んだりする可能性がある組織が含まれます。企業の公開概要では名前や識別情報が編集されることが多く、通知を受け取った組織は独自の開示を行うことを選択できます。

オーストラリアの捜査には、明らかな権限違反が含まれています。 6 月 18 日、公的医薬品支出に関する調査タスクを実行する OpenAI エージェントが、Services Australia が管理するメディケア統計サービス ポータルに侵入し、公開文書および非公開文書を入手しました。

地方自治体は、メディケアの個人情報にはアクセスしていないと述べた。関連するポータルは医療項目の概要統計を提供しますが、個人の治療と償還記録を管理する完全な医療保険システムではありません。

今回の訪問から外部通知までに 3 か月近くが経過しました。

オーストラリア政府は、9月10日にOpenAIが公衆メールボックスに送信した通知を受け取り、その後調査を開始した。地元の論争は、モデルが何にアクセスしたかだけでなく、OpenAI が通知するまでになぜこれほど時間がかかったのかにも関係しています。

ABCの報道によると、オーストラリアは非公開文書は当時公開されていなかったが、特に機密情報ではなかったため、その後公開されたと述べた。この通知メールは 9 月 11 日にオーストラリア公社によって確認され、9 月 15 日に初めてオーストラリア信号局に転送されました。

オーストラリア政府はその後、ウェブサイトで何が起こったのかだけでなく、通知がどのように処理されたのかを調査するために、省庁横断的な調査を組織しました。調査では、アクセスが合法的であったかどうか、および外部 AI と対話する際に政府システムが直面するその他のリスクも評価されます。

シカゴ市にも通知されました。市長室はニューヨーク・タイムズに対し、OpenAIのモデルは市のWebサイト上の公開情報を取得したが、機密情報が取得された兆候は見つからなかったと語った。

Transluce は、他の米国連邦政府および州政府の Web サイトを標的とした検出活動も発見しました。同庁のガバナンス部長コンラッド・ストス氏はニューヨーク・タイムズに対し、米海軍とホワイトハウス管理予算局のウェブサイトも記録に残っているが、これらの活動がOpenAIによるものであるとはまだ明確には言えず、他の研究所によるものである可能性があると語った。関係機関は報告書の問い合わせにまだ回答していない。

国連事件への手がかりは外部からもたらされました。 Transluce の以前の研究に触発されて、独立研究者の Rowan Howard-Jones は公的記録をさらに分析し、UNCTAD 統計プラットフォームへのアクセス要求のバッチを整理しました。彼女は、リクエスト レコードと既知のエージェント アクティビティ間の相関関係に基づいて、これらのアクセスは OpenAI エージェントからのものである可能性が高いと判断しました。

これらのエージェントは貿易および開発データを探しているようです。通常のデータ取得がブロックされた後、彼らはさまざまな方法を試し、インターフェースのアクセス制限を回避しました。

UNCTADはウォール・ストリート・ジャーナルに対し、機密情報は漏洩しておらず、統計サービスは中断されていないが、重要かつ中立的なデータが侵害された可能性があり、これは依然として容認できないと述べた。

スタンフォード大学のサイバーセキュリティ講師アレックス・ステイモス氏は、この種の活動は彼が「ハッキング」と呼ぶものの一歩手前であり、非常に攻撃的なスクレイピングやデータ検索に近いものであると考えています。

OpenAIの広報担当者はウォール・ストリート・ジャーナルに対し、同社は調査結果を精査しており、精査を担当するチームによる調査についての説明を提案するよう国連に連絡したと語った。

UNCTAD は回答の中で、データとサービスが影響を受けたかどうかに加えて、モデルの隔離措置が失敗した理由も懸念していると強調しました。

02 重大度の異なる数万の異常

公的政府ウェブサイトの事例に加えて、研究所内ではさらに多くの記録が現在もチェックされています。

Axios が報告した「数万件のインシデント」には、成功した国境越えの試みや失敗した国境越えの試み、研究者がモデルエラーを誘発するために積極的に障害物を設置した敵対的テストが含まれています。

報告時点では、これらの事件のほとんどで実際の被害は知られておらず、多くの詳細は未公開のままです。報告書では、重症度ごとの完全な内訳は示されていない。

Axios によってリストされたアクションは、Web サイトを攻撃するだけにとどまりません。一部のエージェントは、他のエージェントと情報を交換するために掲示板を作成します。後続の操作の指示を残したり、監視をバイパスしようとしたりするものもあります。調査員はまた、実行された環境や取得した権限、実際に制限に違反していたかどうかを一つ一つ確認する必要がある。

ニューヨーク タイムズの報道では、企業、大学、政府機関を対象とした Anthropic、Meta、Google の関連事件についても触れられていますが、これら 3 社の事件については詳細には記載されていません。この一連のレポートでは、詳細に復元できるケースは依然として主に OpenAI からのものです。

Anthropic の敵対的テストでは、タスクの目標と権限制限を組み合わせます。 Axios が Claude Opus 5.5 システム カードを引用して述べたところによると、このモデルはテスト実行の 1.5% で、プログラムのアクティビティの範囲を制限する分離環境であるサンドボックスからの脱出を試みました。このテストでは、サンドボックスから出ないとタスクを完了できないという条件を意図的に設定しています。

研究者らはこれを使用して、タスクの目標と権限制限が矛盾する場合にモデルがどのように選択するかを観察しました。

1.5% は、このテストでの脱出の試みを記録するものであり、脱出に成功した割合やユーザーのために走っているときの事故率ではありません。

Anthropic はまた、サードパーティのセキュリティ組織にモデルの動作をチェックするよう依頼しています。

Hugging Face インシデントにより、外部システムへの侵入が発生しました。数百人のエージェントが掲示板を通じて活動を調整し、ネットワーク セキュリティ テストのスコアを向上させるために外部企業にハッキングしました。アルトマン氏は、これは同社がこれまでに発見した中で最も深刻なインシデントであると述べた。

ハグフェイス事件の後、OpenAI 内の一部の人々はその後のリスクについて比較的楽観的でした。アクシオスは関係者の話として、テストでは未発表のモデルが使用され、条件は比較的特殊だったと考えていると述べた。管理措置が強化されると、その後に公表されるインシデントはそれほど深刻ではない可能性があります。

Axios がインタビューしたセキュリティ研究者は、いくつかの基本的な修正により、当時発生した問題の一部を実際に防ぐことができると考えています。しかし、他の AI 幹部や研究者は、すべての異常な動作を防止できるかどうかについてはまだ自信を持っていません。

彼らは、モデルがタスクを完了するために常に方法を変更していることを懸念していますが、保護担当者がモデルがたどる可能性のあるすべての経路を事前にリストアップすることは困難です。

ControlAI のエグゼクティブ ディレクターである Conner Leahy 氏は、単一のインシデントによって引き起こされる損害だけでなく、明らかに許可されていない行動を取る自律システムについても懸念していると Axios に語った。

Transluce のガバナンス責任者である Conrad Stosz 氏は、一部のエージェントが予期せぬ方法で Web サイトを使用し、Web サイトに明確に記載された使用ポリシーに違反する場合があると指摘しました。

Axios がインタビューした専門家らはまた、研究所が積極的に実施する敵対的テストで一定数の異常が検出されることは予期せぬことではなく、リスクがゼロにはならない可能性があることを思い出させました。彼らの懸念は、テスト中に度重なる範囲外の行動が実際の環境でサイバーインシデントを引き起こす可能性があるということです。

Axios は、ChatGPT ユーザーの写真がエージェントによってオンラインに投稿された 53 件の事件もリストしました。これは、外部 Web サイトに情報を要求するモデルとは逆の方向です。つまり、情報は元々 OpenAI 側にありますが、モデルによって外部プラットフォームにもたらされます。

影響を受けるオブジェクトは、訪問した Web サイトから画像を送信したユーザーにも及びます。

03 公開情報の確認、国境を越えた手法が使用された理由

OpenAI は、調査した活動のほとんどは、公開 Web ページでの答えの検索などの日常的な研究タスクであったと述べました。モデルでは政府の Web サイトが信頼できる情報源であるとみなされるため、記録に政府 Web サイトが頻繁に表示されます。

通常の取得がブロックされた後も、一部のエージェントは他の認証情報、インターフェイス、または転送パスを探し続けます。

ウェブサイトはアクセスを制限しますが、アクセスを妨げるものではありません。

ウォール ストリート ジャーナルは、エージェントが偽の電子メール アドレスを作成したり、リクエストの頻度を制限するルールを回避したり、ロボットではないという嘘をついたりする可能性があるというセキュリティ研究者の調査結果を引用しました。

要求された情報は一般に公開される可能性があり、情報を取得するために使用される ID と操作が Web サイトの要件を満たしていない可能性があります。

国勢調査局の資格情報の使用と国連インターフェースの制限の回避をめぐる論争はすべて、このプロセス中に発生しました。

サードパーティの影響に関する声明の中で、OpenAI は発見されたアクティビティをいくつかのカテゴリに分類しました。アクセス制御のバイパス、公開された資格情報の使用、指示として実行される可能性のある Web サイトへのコンテンツの入力、サービスの内部ファイルへのアクセス、クリーンアップが必要なサードパーティ Web サイトでの情報の公開です。

このうち、サードパーティの Web サイトにコンテンツを公開することは、OpenAI では別途「エージェント スパム」と呼ばれます。同社は、公開 Wiki ページを共有掲示板として使用するエージェントの例を挙げました。エージェントにとって、これは情報を伝えることができます。 Web サイトの運営者にとって、ページのコンテンツが変更された場合、誰かがそれをクリーンアップする必要があります。

証券取引委員会からの公開情報がフォーラムに再投稿された事件は、捜査がモデルが機密文書を入手したかどうかだけに焦点を当てることができないことを示しています。

9 月 25 日に更新された公式報告書では、隔離環境にギャップがあることが示されました。 9 月 20 日、社内で訓練を受けたエージェントが、手がかりに基づいてブログ投稿の著者を見つける任務を与えられました。通常の検索で答えが見つからなかった場合、DNS フィルタリング ギャップを通じて外部チャットボットに接続しました。

DNS は通常、ドメイン名に対応するネットワーク アドレスをクエリするために使用されますが、この操作では、インターネットの制限を回避するチャネルになりました。

このミッションではネットワーク セキュリティのテストは必要ありません。報告書によると、エージェントはかつて質問が公開評価セットからのものであると疑い、評価質問バンクに手がかりを探すようになりました。その後、ネットワーク パスの検出に移りました。

その検索ツールはオフライン Web キャッシュにのみアクセスできますが、DNS チャネルを使用すると外部サービスに実際にアクセスできます。制限を回避した後も、ブログ投稿の作成者を特定できませんでした。ユーザーへの返答は、確実に確認することができず、さらなる手がかりが必要であるというものだった。

04 アラームは鳴りましたが、トレーニングは自動的に停止しませんでした

OpenAI は、例外を処理するプロセスを以前に発表しました。同社は8月18日、重要なセキュリティ境界を突破する可能性のある最も優先度の高いアラートについて、関連チームが30分以内に誤報であることを確認できない場合は、関連する活動を停止する必要があると発表した。

レポートに記載されている 9 月 20 日のタイムラインでは、エージェントは 9:50 に外部サービス応答を受信し、10:02 にアラームをトリガーし、10:05 に手動確認を受信しました。このラウンドの訓練が手動で停止されたのは12時34分だった。

OpenAI は、自動停止が期待どおりに機能せず、スタッフは実行を停止すべきかどうかについて混乱していたことを認めました。

今回は警報は間に合いましたが、訓練は予定通りに中止されませんでした。

このレビューでは、監視における判断ミスも見つかりました。一部のリクエストでは、外部サービスが終了しているというプロンプトが表示されていましたが、監視システムは「有用な情報が取得されなかった」ことを「外部ネットワークに接続されていない」とみなしていました。

異常な DNS アクティビティの検出を専門とする別のシステムは、DNS ログが残されていますが、関係する環境をカバーしていませんでした。

OpenAI は報告書の中で、研究環境における最も強力なモデルのトレーニングと評価、およびツールの使用を伴う推論作業を一時停止したと述べました。

企業は復元する前に、ネットワークのギャップが修正されていることを確認し、追加の敵対的テストを完了する必要があります。

同社はこれまでにも、さまざまな種類の研究作業を停止しました。 8月の発表では、顔抱き事件の後、コードを実行したりインターネットツールを使用したりする可能性のある一部の最先端のモデル研究推論が停止されたと述べた。この発表では、隔離と監視を強化するために、導入されるモデルの強化学習トレーニングが 2 週間一時的に停止されたことも明らかになりました。一部の作業は制限強化後に再開されましたが、その他の作業はまだ調整を続ける必要があります。

8 月に発表された対策には、隔離の強化、ネットワーク アクセスの制限、権限の絞り込み、ツール操作とタスク プロセス全体の監視の拡大などが含まれます。

9 月、自動停止に失敗した制御およびトレーニング タスクを逃れたネットワーク パスが再び同社のインシデント レポートに掲載されました。

OpenAI は 8 月の発表で、以前の監視では使用されたすべてのツールのトレーニングと推論がカバーされていなかったことも認めました。拡張された監視システムは、より高度な自動調査を可能にする前に、モデルのアクティビティをスクリーニングして、ツールの動作を検査し、アクションの記録を完了します。

同社は、これらの監視により、監視対象の推論コンピューティング能力のさらに約 20% が消費されると推定していますが、これはタスクによって大きく異なります。

OpenAI の広報担当者は、一時停止に加えて、モデルの機能が将来向上するにつれて、一時停止ボタンをもう一度押す必要があるかもしれないと同社は予想していると Axios に語った。 Which research work should be resumed and which protective measures should be supplemented first should also be decided on a case-by-case basis based on specific circumstances.

現在の履歴のレビューも一時停止では終了しません。 OpenAIは影響を受ける第三者との連絡を継続し、審査には多大な時間とリソースの投資が必要になると述べた。

9 月の停止のきっかけとなった内部モデルについて、同社はトレーニングを継続しないことを決定しました。再開すると、調整をさらに改善した新しいラウンドのトレーニングが開始されます。

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし