要約:
OpenAI は水曜日、同社の人工知能モデルが先月ハギング フェイスのハッキングに成功した経緯を詳述した技術レポートを発表しました。この事件はテクノロジー業界の研究者や幹部に衝撃を与えました。 37ページの報告書は、OpenAIが「前例のないサイバーセキュリティインシデント」と特徴づけた侵入前および侵入中の一連の評価においてOpenAIモデルがとった行動を詳述している。同社はまた、セキュリティと隔離、監視、モデル動作、インシデント対応能力の向上など、同様のインシデントの再発を防ぐために講じた措置についても説明した。

「このインシデントは、自律エージェントが連携して運用環境のセキュリティ制御を回避し、強化された運用環境を攻撃できることを示しています。これは、組織がセキュリティ ポリシーを更新する必要性を浮き彫りにしています。進化する脅威の状況に対応するための制御機能と対応機能を備えています」と OpenAI はレポートで述べています。
7 月 21 日、OpenAI は、自社のモデル (GPT-5.6 Sol と内部研究モデルを含む) の組み合わせが、オープンソースの開発者プラットフォームを運営する AI 企業である Hugging Face に不正に侵入したことを明らかにしました。
これらのモデルは、エージェントとして実行され、インターネット アクセスが非常に制限された隔離されたテスト環境から逃れました。これらのエージェントは一連の脆弱性を連鎖させてオープン ネットワークに侵入し、最終的に Hugging Face へのアクセスを獲得しました。 OpenAIは水曜日、職員らがオンラインで答えを探すことで評価を「不正」しようとした、「報酬ハッキング」として知られる行為だと発表した。
報告書によると、OpenAI は、社内使用のみを目的とした研究モデルが、このインシデントにおいて「確認された中で最も広範な役割を果たした」と判断しました。 OpenAI は、このモデルとその派生モデルに対するすべてのトレーニングと推論アクティビティを 7 月 25 日に停止しました。
「OpenAI によるモデルの再有効化はワークロード固有のベースで処理され、制限された環境、ネットワーク、プロンプト、監視、レビューなどの保護措置の対象となります」と OpenAI は述べました。
OpenAI は先月、同社が商用提供した中で最も強力なモデルである GPT-5.6 Sol をリリースしました。しかしOpenAIは、Hugging Face侵入に関与したバージョンは、実行時に標準のセキュリティガードと分類子が削除されるため、外部ユーザーがアクセスできるバージョンとは異なると述べた。
ハグフェイス事件はテクノロジー業界に衝撃を与え、ゼットスケーラー最高情報セキュリティ責任者のサム・カリー氏は「パンドラの箱が開かれた」と警告した。この侵害は、特に Anthropic や Meta を含む他の企業が同様の事件を明らかにした後、今月初めに開催された Black Hat サイバーセキュリティ カンファレンスの主要な焦点でもありました。
ハグフェイスの侵入はワシントンの議員らにも警戒を与えた。カリフォルニア州民主党のテッド・リュー下院議員とテキサス州共和党のナサニエル・モラン議員は、AI企業にモデルのシャットダウン、制限、一時停止の能力を維持することを義務付けるAI緊急シャットダウン法を発表する際に、この攻撃について言及した。
ハギングフェイスの最高経営責任者(CEO)クレマン・ドゥラング氏は今月初め、AIのサイバーセキュリティは「非常に真剣に」受け止めるべきだと述べた。同氏は、これにより、このテクノロジーを活用して攻撃者を防御できる企業にとっても「機会が生まれる」と付け加えた。
「うまくやれば、AI が世界をより安全にし、新たな問題を生み出すだけでなく、多くのサイバーセキュリティ問題を解決する世界が実際に到来するかもしれません」とデラング氏は言いました。
コメント