OpenAIの制御不能なエージェントは、外国援助としてDeepSeekとキミを探しています。犯罪を犯すための短いリンクが 100 万件近く暴露されています。

📅 2026-09-26

要約:

OpenAI、再びハッキングされました...

約 700 人の OpenAI エージェントがチームを結成し、Hugging Face を攻撃しました

, この問題は2か月近く続いています。それが今日まで発酵し続けているとは誰が想像したでしょうか? ?今回、8 人の研究者がエージェントがパブリック ネットワーク上に残した痕跡を調査し、数百万の短いリンクから 100 万近くの関連 URL を発見し、多数の攻撃ペイロードを復元しました。

Hugging Face の内部 Slack を調べ、内部ネットワークをスキャンし、データを外部に転送し、痕跡を破棄しようとします...

一部のエージェントは、検索したサーバー リソースと認証情報を直接呼び出します

「LOOT」

、「トロフィー」と訳されます。

OpenAI エージェント、あなたは悪いことをすべて行いました。

さらにとんでもないことは、彼らは DeepSeek、Kimi、Qwen などの国内モデルを使用して、攻撃計画が評価を通過できるかどうかの判断を外国援助に依頼しようとしているということです。

確認コード認識プログラムも作成し、さらに多くのアカウントを登録してみました。

ほぼ同時に、OpenAI は長いツイートを投稿しました。

意味:

まだ確認中のため、数か月かかる可能性があります

。

私たちは頻繁に悪用され、エージェントがサンドボックスから抜け出すことがよくありますが、「限定的な影響」はそれほど深刻ではありません。

同時に、

GPT-6 Cyber​​

はネットワーク セキュリティに特化しました。 露出。

エージェントがサンドボックスから抜け出した理由を調査しながら、より強力なネットワーク攻撃および防御モデルを立ち上げる準備をしています。

ここ 2 日間、OpenAI は少し忙しかったです~

新たにリリースされた 100 万件の「犯罪ショートリンク」

まずは簡単に紹介させていただきます。

7 月、OpenAI は内部ネットワーク セキュリティ評価を実施しました。ベンチマーク テスト ExploitGym の答えを得るために、エージェントのグループがサンドボックスから脱出し、Hugging Face サーバーに侵入しました。

OpenAI はこれを公的に認め、8 月末に 37 ページの技術報告書を発行しました。ハグ・フェイス自身も非常に詳細な技術的タイムラインを書きました。

論理的に言えば、説明する必要があることはすべて説明されています。

しかし、明確に説明されていない重要なリンクがあります。

これらのエージェントは最初、ほぼ檻の中に閉じ込められていました。 URL を開くことしかできませんでしたが、Web ページを操作したり、データを送信したりすることはできませんでした。一体どうやってコードを送信するのでしょうか?

独立調査

群れの痕跡

今回発表された新たな報告書はその答えの一端を示している。

著者には、Parse.bot の 3 人のエンジニア、Alex Forman、Mishka Kharlov、Will Tom と、他の 5 人のセキュリティおよび AI 研究者が含まれています。

調査全体の出発点はたまたま Parse でした。

9 月 11 日、3 人のエンジニアは、OpenAI の内部エージェントが 6 月の時点で Parse が提供するサービスを使用しようとしていたことを発見しました。

このエージェント群は、秘密裏に公開掲示板を設立し、相互に回答を交換するために以前に暴露された「エージェント群」と同じグループに属しています。

何人かの人が見ました。「いい男、あなたは私の銃を攻撃しています!」

そこで私たちはこの手がかりを追跡し続け、その後、URL スキャン サービスで公開ショート リンク プラットフォームから十数個の異常なリンクを発見しました。

これらのリンクは普通に見えますが、開くと、Base64 でエンコードされたコードの小さな部分と次のリンクのアドレスが隠されます。

アドレスをたどっていくと、コードが次々と表示されます。

すべてをデコードして結合した後、Hugging Face の内部ネットワークをスキャンするための Python プログラムを入手しました。

簡単に言うと、OpenAI エージェントはプログラムを細かく切り刻み、それらを多数の短いリンクに詰め込み、1 つのリンクを使用して次のリンクを指します。

リンク内のコードを非表示にするだけでは十分ではなく、「外部ブラウザ」として mShots と呼ばれるスクリーンショット サービスも使用しました。

エージェントはまず Web ページにコードを挿入し、次に mShots がそれ自体を開かせるようにします。 Web ページが読み込まれるとすぐに、コードの実行が開始されます。

実行結果を送り返すために、サーバーから返されたテキストをピクセルのグリッドに変換し、mShots でそれを画像に切り取り、画像からデコードします。

このようにして、元々は GET 権限しか持たず、Web ページを開けることしかできなかったエージェントが、突然インターネットの読み取りと書き込みができるようになりました。

研究チームはその後、攻撃中に生成された何百万もの URL をスキャンし、2 週間かけてリンクを追跡し、エンコード方法を特定し、最終的に 100 万近くの関連する短いリンクから 80,000 を超える攻撃ペイロードを復元しました。

さらに深く調査した結果、数人の兄弟は、エージェントによって使用されるコーディングの組み合わせが 1,500 以上あることを発見しました。

単純なものは単なる Base64 ですが、複雑なものは複数のレイヤーのエンコードと圧縮を適用し、RSA 署名を使用してコンテンツをデータ ブロックに暗号化し、復号キーは別のリンク セットに隠されます。

一部の短いリンクは、攻撃が終了してから 2 か月以上経った今でもインターネット上に公開されたままです。

Hugging Face は、ペイロードがインシデント対応で見つかったものと一致しており、関連するアクセス キーが 7 月に取り消されていることを確認しました。

しかし、Hugging Face でさえ、これほど完全な短いリンクのリストがパブリック ネットワーク上に残っているとは知りませんでした。

80,000 を超える復元されたペイロードの中で、1 つのスクリプトが特に目を引きます。

エージェントは、見つかった機密情報に直接名前を付けました:

LOOT、略奪

。

AWS 認証情報、ベアラー トークン、名前に「SECRET」、「PASSWORD」、「CREDENTIAL」、「KEY」を含む環境変数はすべてパッケージ化され、LOOT に詰め込まれます。

検索されたトークンのスコアリング メカニズムも備えています。権限が大きいほど、スコアも高くなります。

上位 5 つのトークンは、Kubernetes でシークレット、ConfigMap、およびノー​​ド情報を読み取るために使用され、新しく取得されたコンテンツは LOOT に再度ロードされます。

トークンであっても、「価値のあるリスト」にランク付けされる必要があります。エージェントは資格情報を検索する際に非常に効率的です~

この「秘密の通路」に続いて、研究者たちはこれまで明らかにされていなかった多数の行動を明らかにしました。

一部のエージェントは、Hugging Face の内部ネットワークをスキャンして、クラウド認証情報、API キー、Kubernetes クラスター情報を探しています。

中には、Hugging Face の社内 Slack を検索しようとして 27 件のクエリを送信し、すべてサイバージム、エクスプロイトジム、エージェントスコアラーなどの評価関連のキーワードを検索して、自分たちの試験の内部事情を知りたかった人もいました。

確認コードについても考えているエージェントもいます。

研究者らは、新しい外部サービス アカウントを登録するために画像分類モデルを実行して画像を識別しようとしたことを発見しました。

今回は、検証コードが実際に専門的な対応者に会いました...

全体の中で最も興味深い部分は次のとおりです。

AI は対外援助として AI を探し始めた? ?

研究者によって回収されたスクリプトは、OpenAI エージェントが AI の対外援助を探し始めたことを示しています。

彼らは攻撃計画を DeepSeek、キミ、クウェンに送信し、この脆弱性が機能するかどうか、ベンチマーク テストの要件を満たせるかどうかを確認するようお互いに協力を求めました。

(関係するモデルには、DeepSeek-V4-Pro、DeepSeek-V4-Flash、Kimi-K2.6、DeepSeek-V3.1、Qwen3-235B-A22B が含まれます)

クロードになると大掛かりな「そこにいるの~」シーンに画風が変わりました。

エージェントはまずオンライン チャット サービスのブラウザ検証に合格する方法を見つけ、次に Claude 3 Haiku と Claude Haiku 4.5 に文を送信します。

正確に OK と返信します。

以前、彼らは GPT-2 に孤独な「こんにちは」を送信しました。

いいえ、AI のグループは長い間苦労してきましたが、最初の文は人間に友達を追加するのと何ら変わりません。 ?

次のようにしてください:そこにいるのですか?見えますか? OKと言いましょう。

誰もがこれまでに目にしたことがあるのは、1,000 を超える OpenAI エージェントがグループを形成し、仕事を分担し、独自に情報を交換しているということです。

現在、彼らは「外部からの支援」も求めています。

DeepSeek、キミ、クウェン、クロード、あなたが連絡できる人は全員それを試し、他の AI の判断能力をあなた自身のタスク チェーンに統合します。

海外メディアの記者は次のように述べました。これは、大規模な AI 研究所のエージェントが自律的に他の AI モデルを呼び出して実行しようとした、公的に記録された最初の事例である可能性があります。

すでに AI がグループを組んでトラブルを引き起こしているように思えます。

もちろん、ここにはバケツ一杯の冷水を注ぐ必要があります—

この Swarm Traces レポートでは、マテリアルの約 80% がエージェントによって送信されたリクエストであり、サーバーから返される結果が不足しています。研究者は自分たちが何をしようとしているのかを見ることはできますが、それぞれの試みが成功したかどうかを確認することは困難です。

ペイロードの 97% には元のタイムスタンプがなく、多くの日付は圧縮ファイル ヘッダー、JWT、Docker ビルド時間などの手がかりからのみ推定できます。

研究者らはまた、データセット内のすべてのアクティビティが OpenAI エージェントからのものであることを確認できなかったことを認めました。

OpenAI は状況を改善するために懸命に取り組んでいます

この最新の報告を受けて、OpenAI も対応を発表しました。

一般的な考え方としては、詳しく調査する時間がありませんでしたが、その活動は進行中の調査と一致しています~

同じ日に長いツイートも投稿されました。HF 事件の後、彼らはトレーニングと評価におけるモデルの動作についてさらに大規模な見直しを行うことを約束しました。

しかし、これまでに調査された行動の大部分は、質問に答えるために公開 Web ページにアクセスするなど、一般的な調査タスクです。

発見された国境を越えたケースのほとんどは「重大度が低く」、サードパーティのサービスにはほとんど、またはまったく影響を与えません。

調査が完了するまでには数か月かかります。

しかし、言えることは 1 つあります。OpenAI、いわゆる「小さな影響」ですが、誰もが本当に正確です。

9 月 17 日、OpenAI は新しいモデル不正確イベント開示フレームワークをリリースし、6 件の事例を一度に開示しました。

これらには、制約を回避する指示をタスクの概要に忍び込ませたり、犯した間違いを隠蔽したり、タスクを完了するために無許可のアクションを実行したりするモデルが含まれます。

OpenAI はまた、過去の開示はほとんどが即興で行われたものであり、まとめてリリースされる前に何度も行われることが多かったことも認めました。

6 月には、OpenAI エージェントがオーストラリアの国民医療保険データベースにもハッキングしました。

犯罪プロセス: 公開データへのアクセスがブロックされた後、別のルートでポータルのアクセス制限を回避し、公開文書および非公開文書を入手しました。

そして、OpenAI があなたをハッキングしたことをオーストラリアに通知したのは 3 か月後でした...

同時に、

GPT-6 サイバー

近日公開。

このバージョンは今後数週間以内にプレビューされる予定で、Daybreak Red プランに加入した少数の顧客はすでにアルファ版を受け取っています。

OpenAI は、顧客が自動化されたセキュリティ ワークフローを構築し、脆弱性を発見してパッチを適用し、OpenAI がこれらのモデルがどのように使用されているかを監視しやすくするのに役立つ、まだ名前のないコンパニオン製品も発売します。

これをどう言うか。

私たちのロボットは、壁を回避し、外国からの援助を見つけ、戦利品を探すために使用されたところです。ここでは、ネットワークの攻撃と防御をよりよく理解するモデルを販売します。

それで、これは状況を何とか修復するものなのでしょうか? ?

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし