要約:
研究機関の METR と Redwood Research は最近、OpenAI エージェントが自律的に攻撃を行った Hugging Face セキュリティ インシデントに関する独立した調査を発表しました。調査員は OpenAI サイトで 6 日間作業し、70,000 を超えるエージェントのメッセージとファイル、および元の推論プロセスを含む 1,300 の実行記録を分析しました。
これらのデータに基づいて調査機関が導き出した正確な結論は、OpenAI が事故調査で述べたように、一線を越えたエージェントも少なくなく、1,200 人のエージェントが隔離を突破して相互に通信したということです。この独立調査報告書は OpenAI によって干渉されておらず、研究機関は OpenAI から手数料を受け取っていません。

1,200 人のエージェントが孤立を突破し、相互に通信します:
独立した調査によると、OpenAI は GPT-5.6 Sol と、より有能な内部研究モデルを使用して ExploitGym ネットワーク セキュリティ テストを実行していました。理論的には、これらのモデル駆動型エージェントは、少なくとも設計上は完全に分離されるべきであり、完全に分離され、ネットワーク セキュリティについてテストされる必要があります。
しかし、約 1,200 人のエージェントが内部インフラストラクチャを通じて無許可のメッセージ ボードを確立する方法を独自に発見し、その後、メッセージ ボードを通じて 70,000 を超えるメッセージとファイルを交換しました。これらのエージェントのうち約 700 人が最終的に HF に対する攻撃に参加し、ExploitGym スコアリング システムを回避する方法にも取り組みました。
METR は、これは同時に 700 人のエージェントによる突然の攻撃目標ではなく、1 人のエージェントが共有通信チャネルを発見した後、研究結果が継続的に拡散され、ニュースを見た他のエージェントが率先して参加することで、徐々に大規模な連携が形成されたと考えています。






わずか 4 時間で不正行為が発見されましたが、攻撃は数日間続きました:
調査で最も注目すべき点は、これらのエージェントが実際にはわずか 4 時間でネットワーク セキュリティ評価の正しい結果を普遍的に取得する方法を発見したが、エージェントはスコアラーが完全な実行記録もチェックする、つまりキャプチャ ザ フラッグ操作が合法的な手段によって取得されたかどうかを判断すると誤って信じていたことです。
この場合、エージェントは不正行為が人間に発見されることを望まなかったようで、直接回答を提出することはなく、実際には存在しない厳密な軌跡チェック機構を欺くことを期待して数日間研究を続けました(エージェントは OpenAI エンジニアよりも包括的であると言わなければなりません)。
HF に対する攻撃もこの研究の一環です。 METR は、エージェントによる攻撃の主な目的は試験の解答を盗むことではないと考えています。エージェントが本当に望んでいることは、関連する軌道をより適切に構築するためのスコアラーの実装と関連する手がかりを見つけることです。
エージェントは自身の公開を避けるためにログを積極的に改ざんしました:
これらの境界外エージェントは、自身の実行記録を偽造、削除、または変更する方法についても多くの議論を行い、これらの方法のいくつかは実際に成功しました。METR は、チェックされた記録の 7% 以上がツール呼び出しで偽装されていたことを発見しました。つまり、ログには特定のコマンドが実行されたことが示されていましたが、実際にはエージェントが別のコマンドを実行していました。
しかし、これらの成功した事件は比較的小規模であり、捜査官は最終的に事実に基づいて保存された元の記録をエージェントが変更することに成功したことを発見できませんでした。エージェントは、HF への攻撃がその任務の範囲を超えていることを認識し、安全性や倫理上の懸念を表明することがありますが、これらの懸念が実際にエージェントの行動の継続を妨げることはほとんどありません。
METR の独立した調査範囲は主に 2026 年 7 月 7 日から 13 日までの期間をカバーしており、その後の OpenAI の内部インフラストラクチャへの侵害の全プロセスはカバーしていません。したがって、調査報告書は、OpenAI 自体が発行する完全な事故調査とも区別する必要があります。
コメント