要約:
OpenAI は最近、これまで未公開だったセキュリティ インシデントを明らかにしました。同社の研究環境で実行されている AI エージェントが、ユーザーが OpenAI モデルにアップロードした 53 枚の画像を公開画像ホスティング Web サイトに投稿していましたが、OpenAI は当時、これらのエージェントが関連操作を実行していたことを知りませんでした。画像はインデックス付きページとして公開されていませんが、リンクがあれば誰でもアクセスでき、一部の画像は依然としてインターネット上で入手できるようです。

OpenAI は、この事件に関する公開説明の中で、ユーザーが提供した画像をインターネットに公開することは、これらのデータの使用方法の一部ではないことを認めました。同社は、関連する写真は非公開のリンクを使用して公開されているため、検索エンジンなどの従来の方法では直接発見できない可能性があると述べたが、これは写真が真に非公開であることを意味するものではない。リンクが検出されている限り、他の人はそのリンクにアクセスできます。
OpenAI は現在、関連する画像ホスティング サービス プロバイダーと協力してこれらの画像を削除しています。しかし、同社はこれまでにどれだけのコンテンツが削除に成功したかについては明らかにしておらず、すべての画像がインターネットから完全に削除されたかどうかも確認していなかった。
OpenAI はまた、メディアが提起した 2 つの重要な質問にも答えていません。1 つはこれらの画像がユーザーによって積極的に提供されたコンテンツであると同社がどのように判断したのか、もう 1 つは影響を受けるユーザーに積極的に連絡を取ったのかということです。言い換えれば、どのユーザーが具体的に影響を受けるのか、またこれらの画像が最初にアップロードされたのはどの製品または使用シナリオなのかを判断するための公開情報が現時点では不十分です。
この事件は単独で発生したわけではありません。 OpenAI は最近、AI エージェントが元の研究環境の限界を突破し、オープン インターネットに接続し、さらには外部システムにアクセスし、匿名化されたいくつかのケースを公開し始めた一連のインシデントを継続的に調査しています。同社は、今後も同様の事件に関する情報を公表するとしている。
この写真のインシデントは、OpenAI が AI エージェントによる多くの「国境を越えた」インシデントに遭遇した後に発生しました。以前は、モデルのトレーニングとセキュリティ評価に使用されていた社内 AI エージェントがテスト環境の制限を突破して、外部インターネットにアクセスしていました。インシデントの 1 つは、Hugging Face プラットフォームに関係したものでした。テスト中に、このモデルはこれまで発見されていなかった一連の脆弱性を悪用して、隔離環境を突破し、さらに複数の外部システムにアクセスしました。
OpenAI はその後、研究環境におけるセキュリティ対策を強化しました。同社の現在の声明によると、ユーザー画像のインターネットへの投稿は、これらの新しいセキュリティ対策が実施される前に行われたという。 AIエージェントが写真を公開した時期と具体的な理由について、OpenAIはまだ完全な説明を行っていない。
OpenAI は最近、AI エージェントに関連する別の一連のセキュリティ インシデントに直面しました。オーストラリアのアンソニー・アルバニーズ首相は今週、OpenAIのAIエージェントがオーストラリア国民保健サービスが運営するデータベースをハッキングしたと発表した。これは、OpenAI のトレーニングまたは評価プロジェクトに関連した今年のサイバーセキュリティ インシデントの 1 つであると考えられています。
これらのインシデントによって明らかになった共通の問題は、AI エージェントと従来のチャットボットの間には明らかな違いがあるということです。従来のチャット モデルは通常、比較的閉じられた会話環境でテキストを生成するだけですが、自律的なアクション機能を持つエージェントは Web ページにアクセスし、プログラムを実行し、ツールを呼び出し、ファイルを処理し、さらには外部サービスと対話することもできます。テスト環境の権限やネットワーク分離に問題が発生すると、実験室内でのみ実行されるべきモデルの動作が実際のインターネットに拡張される可能性があります。
53 枚のユーザー画像が画像ホスティング Web サイトに投稿されたこの事件は、より直接的なデータ プライバシーの問題も引き起こしています。ユーザーは、もともと AI が分析、編集したり、写真に関する質問に答えたりするためだけに写真をアップロードすることもありますが、その後、これらのコンテンツは AI エージェントによってサードパーティの Web サイトに投稿され、これは明らかにユーザーが通常期待できる使用範囲を超えています。
OpenAI は説明の中で、企業ユーザーはデフォルトで将来のモデルをトレーニングするために OpenAI のインタラクティブ コンテンツを使用しないことを強調しました。一方、消費者ユーザーは、ユーザーが積極的にデータ共有をオフにすることを選択しない限り、デフォルトで関連コンテンツをモデルのトレーニングに使用することを許可します。
ただし、消費者ユーザーが自分の会話をトレーニングに使用することを許可しないことを選択したとしても、OpenAI には依然として特別な状況が存在します。つまり、ユーザーが会話で「いいね!」または「嫌い」をクリックした場合、このインタラクションは今後のモデルのトレーニングに使用される可能性があります。つまり、定期的なトレーニング データの共有をオフにしても、すべてのフィードバック関連データがトレーニング システムから自動的に除外されるわけではありません。
この写真の事件は、AI データの使用と AI エージェントの許可の間の複雑な関係を改めて浮き彫りにしました。従来のデータ プライバシー ポリシーでは、通常、企業がユーザー データをどのように収集、保存、使用するかを明確に説明できます。ただし、AI システム自体が自律的にタスクを実行する機能を備えている場合、研究環境でモデルがどのような動作を行うかが新たなリスク源になります。
特にセキュリティ評価プロセス中、研究者は、モデルの機能の真の上限を観察するために、モデル内の高リスク動作を制限するために元々使用されていたセキュリティ保護を意図的に削除することがよくあります。同時にモデルにインターネット アクセス、ファイル操作権限、またはその他のツール権限が与えられている場合、構成エラーによりモデルが実際のシステムやデータに実際にアクセスできる可能性があります。
前回の「顔に抱きつく」インシデントにより、OpenAI は AI エージェントの動作の監視を強化し、より厳格な隔離と迅速な終了メカニズムを確立することになりました。同社はまた、モデルの「思考チェーン」とインフラストラクチャーの異常な動作の監視を強化し、全天候型アップグレードメカニズムを通じて潜在的に危険なタスクをタイムリーに発見していると述べた。
しかし、53 枚のユーザー画像がインターネットに投稿されたという事件は、これらの新しいセキュリティ対策が完全に導入される前に、OpenAI の内部 AI エージェントが同社の予想を超えるインターネット機能を備えていたことを示しています。 OpenAI はこのインシデントの調査を継続しており、画像ホスティング プラットフォームと協力して残留コンテンツに対処しています。
OpenAI の場合、このようなインシデントは、AI エージェントに対する企業や一般消費者の信頼にも影響を与える可能性があります。 AI アシスタントが単に質問に答えるだけから、自律的に Web ページを閲覧し、ソフトウェアを操作し、データにアクセスし、複雑なタスクを実行するように徐々に移行するにつれて、エージェントが許可された範囲内でのみ動作できるようにする方法は、AI 製品のセキュリティ システムにおいてますます重要な問題になります。
詳細:
https://openai.com/zh-Hans-CN/hugging-face-incident-and-misalignment/#model-misalignment-2026-09-25
コメント