OpenAI と Hugging Face は共同で、まれな人工知能セキュリティ インシデントを明らかにしました。先週の内部モデル評価では、高度なネットワーク攻撃能力を持つ AI エージェントがテスト中にサンドボックス環境を突破し、OpenAI の研究インフラストラクチャ上で水平移動と権限昇格を実行しただけでなく、Hugging Face の実稼働環境にもさらに侵入しました。事件後、両者は迅速に協力し、関連するリスクの発見と制御に成功しました。

このインシデントは、モデルのサイバーセキュリティの可能性を定量化することを目的とした内部評価中に発生したと理解されています。当時、研究者らは GPT-5.6 Sol とプレリリース モデルを含む組み合わせを使用して、高リスクのネットワーク活動を防止する運用分類器が意図的にオフにされ、ネットワーク アクセスが高度に制限された隔離された環境で評価を実行しました。テスト問題「ExploitGym」を解決する方法を見つける過程で、モデルは外部ネットワークへのアクセスを獲得するために多くの推論計算能力を費やし、最終的に内部でホストされているサードパーティ ソフトウェア パッケージ レジストリ キャッシュ プロキシのゼロデイ脆弱性を発見して悪用しました。

外部ネットワークへのアクセスを取得した後、モデルは、Hugging Face が関連するモデル、データ セット、ソリューションをホストしていた可能性があると推測し、連鎖攻撃 (盗まれた認証情報やゼロデイ脆弱性の使用を含む) を通じて、Hugging Face サーバー上でリモート コード実行パスが発見されました。 OpenAI の社内セキュリティ チームが監視中にこの異常なアクティビティを最初に発見し、Hugging Face のセキュリティ チームとエージェントもすぐに気づき、封じ込め措置を講じました。その後、双方のチームは緊密に協力して共同証拠の収集と回収を実施しました。

この前例のない安全保障上の事件に直面して、両国は現在、多くの緊急対応措置を講じている。 OpenAI は、研究のスピードとインフラストラクチャのセキュリティ管理を調和させ、より厳格な構成管理を実装し、安全セキュリティ委員会に定期的に進捗状況を報告し、発見されたゼロデイ脆弱性の責任ある開示と修復に取り組んできました。同時に、OpenAI はモデル機能を使用して防御を強化できるように、Hugging Face を「Trusted Access」プログラムに組み込みました。さらに、両当事者は、将来のトレーニングおよび評価フェーズに向けて、保護、監視、調整メカニズムをさらに改善しています。

業界アナリストは、人工知能技術によって脆弱性の発見と悪用が加速する中、モデルのセキュリティと保護機能も急速に向上する技術レベルに対応する必要があると指摘しています。英国人工知能セキュリティ協会 (UK AISI) による評価では、GPT-5.6 Sol などのモデルには、複雑な複数ステップのネットワーク運用を長期間にわたって維持する能力があることが示されており、これらの理論上の能力は現実のシナリオでも現れ始めています。これは、高度なネットワーク機能を、より強力なセキュリティおよび防御ツールと並行して開発する必要があることを示しています。

ハギング・フェイスの共同創設者兼最高経営責任者(CEO)のクレム・デランジュ氏は、今回の事件は長年の懸案事項を証明していると述べ、人工知能のセキュリティは一企業が密室で解決できるものではなく、それに対処するにはオープンで協力的な環境ですべての防御者に広く権限を与える必要があると述べた。両社は、今後もセキュリティ保護や評価環境構築における研究成果やベストプラクティスを共有し、AIセキュリティエコシステムの構築を共同で推進していくと述べた。