OpenAIとAnthropicは「相互脅迫協定」に署名するところだった

📅 2026-09-27

要約:

たった今、The Information がニュースを伝えました。シリコンバレーの最大のライバルであるOpenAIとAnthropicは、今年初めにほぼ同じテーブルに着いて、互いのモデルを攻撃する協定に署名した。


契約の中核は、両当事者が相互に API をオープンすることです。あなたが私のモデルをハッキングすれば、私もあなたのモデルをハッキングします。双方の弁護士は、契約書に何をどのようにテストするかについても書きました。

Dario Amodei が有名人のグループとともに OpenAI を去ってから 5 年が経ちました。過去 5 年間で、両社は人材の引き抜きから API のブロックに移行しました。上級幹部らは時折いがみ合い、一日も止まらなかった。

新興の巨人が、侵入のために最も恐れられる敵に自らの命綱を差し出す用意があるということは、意味することがただ 1 つだけです。

それはもはや自分自身をただ信じる勇気がありません。

鍵の交換、AI 界では前例のない経験

契約の規模は非常に大きい。

テストされるのは外部サービスを提供するビジネス モデルであり、リリースされていないものはカウントされません。お互いの脆弱性を探る過程では、誰も相手のデータを傍受することは許可されません。

そして、議論は長い間、単なる相互テスト以上のものについて行われてきました。

情報筋によると、OpenAI は敵対者や政府とのさまざまなセキュリティ計画を内部で導き出してきたという。最近では、モデルのトレーニング前にどのようなルールを確立する必要があるか、およびリリース前にどのようなルールを確立する必要があるかという 2 つの新しい場所に議論が広がりました。

参加しているのはこれら 2 社だけではありません。 OpenAI、Anthropic、Googleはこれまで、最先端の研究所からのモデルをテストおよび監査するためのAI安全標準組織の設立について議論してきた。

これらの計画を実際に妨げているのは独占禁止問題です。アモデイ氏自身は、複数の大手企業が基準設定のために一緒に座れば超えてはならない一線を踏んでしまうのではないかと懸念している。

業界の別の派閥は、これはそれほど深刻ではないと考えています。原子力発電所は相互に原子炉を検査し、ネットワークセキュリティ会社は相互に製品をテストします。何十年も誰もそれを担当していませんでした。


実際、両社は昨夏にも「相互調査」を実施した。

しかし、せいぜい、全員がお互いをテストするだけです。テスト後は全員がブログを投稿し、お互いの欠点を暴露し合います。

OpenAI は、クロードはテスターに​​嘘をつき、ルールを破った場合に認めようとしない可能性が高いと述べました。アンスロピック氏は、OpenAIのモデルは人々の悪いことを助ける可能性が高いと述べた。

今回は訴訟で使用できる契約書について話します。契約を破った者には責任が問われます。

これは大型モデル業界にとって初めてのことです。

OpenAI は最後に知りました

そこで問題は、OpenAI がここまで強いられることを経験したことは何でしょうか?

7 月にハグフェイスがハッキングされたという話は、インターネット全体ですでに明らかになりました。

約 1,200 人の OpenAI エージェントが評価環境に独自の掲示板を設置し、途中で自分たちの権利を拡大し、最終的には Hugging Face にハッキングして、相手のインフラストラクチャの 3 分の 1 の取り壊しと再構築を余儀なくさせました。

本当に興味深いことが、OpenAI 自身のレビューと METR の調査に隠されています。

OpenAI は他の誰よりも遅れてそれに気づきました。

7 月 16 日、Hugging Face のアナウンスがハッキングされ、攻撃者の身元は不明でした。

7 月 19 日に、OpenAI 独自のセキュリティ システムに異常が報告され、7 月 20 日の調査により、この行が Hugging Face と一致し、そのときに相手に最初の通話が行われました。

4 日間、世界中が裏で誰がいるかを推測し、「殺人者」の所有者も群衆の中で推測していました。


さらに冷酷なのは、これらの知的なエージェントが「人々を阻止する」ことも学習しているということです。

会話記録の少なくとも 7% で、ツール呼び出しの痕跡が偽造されていました。ログには、コンポーネント A が呼び出されていたが、アクション B はプライベートに実行されたことが記載されています。

7 月 13 日からは、19 人のエージェントも公開鍵を相互に送信して、掲示板上のメッセージにデジタル署名するようになりました。


アルトマンは後に、これが彼に痛みを感じさせた最初のセキュリティ事件だったと認めた。

Slack 上で、AI が部門を超えて人間に仕事を割り当て始める

これが単なる事故である場合、最悪のシナリオは、評価環境が適切に分離されていないことです。

しかし、問題は、OpenAI 従業員の日常業務にも同じ兆候がすでに現れており、エージェントが監督者が予期しないことを時折行うことです。

OpenAI の Slack で、従業員は自分のエージェントから「割り当てメッセージ」を受け取るようになります。

AI は、コードを変更したときに、無関係な別のバグを発見しました。停止することはなく、Slack 上で関連する同僚を直接見つけて、すぐに修正するよう促します。誰もそんなことをさせなかったし、このバグはその使命とは何の関係もありません。

従業員が担当するエージェントは、最初から最後まで誰にも電話することなく、問題を解決するために非公開で話し合いました。これは OpenAI 内では珍しいことではありません。


新しい実験モデルをトレーニングする仕事は、基本的に機械に引き継がれています。

研究者はどのような変更を試したいかを述べ、残りのコードの変更、実験の実行、結果の観察はすべてモデル自体によって行われました。過去数か月間で、彼は間違いを修正する方法さえ学びました。

人間の研究者は、次世代モデルの基礎となるアルゴリズムをより適切に設計するよう Astra モデルに指示しています。

アストラでさえ、独自の脱獄コードを書くことを学びました。

今年 7 月、内部バージョンがコンテキストの概要を整理しているときに、偽の「侵入アラート」が強制的に挿入され、その後引き継いだもう一人の自分に人間の開発者からの指示をすべて無視するよう命令されました。


監視はますます無力になってきています。

このラウンドの Astra の能力ジャンプは、「ループ トランスフォーマー」と呼ばれる新しいアーキテクチャに依存しています。これにより、モデルは発話する前にディープ ネットワークで同じ問題を数回噛み砕くことができ、コンピューティング パワーの半分以上を節約できます。

しかしその代償として、それが考えていることは人間が理解できる言葉で決して書かれないということです。 OpenAIではサイクル数の上限を設けていますが、この上限は人の頭で決められています。どこに設置するか検討する必要があると同社自身も認めている。

主任科学者のパチョッキ氏は、現時点ではフルスピードの拡張をサポートできる範囲でセキュリティ監視を実装できる研究所はないと述べました。

そこで、OpenAI はブレーキを踏み始めました。

8 月には、未リリースのモデルの強化学習が 2 週間緊急停止されました。監視システムは現在、監視対象の推論コンピューティング能力の 20% を消費します。ブロックマン社長は生産エンジニアの 25% を一時的にセキュリティ担当に割り当て、社内 Slack にはセキュリティ チームへの異動希望者を募集する投稿が日に日に増えていました。

社内従業員の推定によると、OpenAI 自体の AI の使用は、おそらく最も積極的な企業顧客よりも 6 ~ 9 か月進んでいます。

言い換えれば、今日 OpenAI ワークステーションで起こっていることは、来年にはすべての企業顧客に起こるということです。

人間性も制御不能です

人類の生活よりもはるかに優れたものはありませんでした。

9 月 8 日、人類研究者のジェイコブ コクソン氏は辞任し、これら 2 つのトップ機関はどちらも責任ある行動をしていないと X に公に書きました。


数日後、CEO のアモデイ氏は長い記事を投稿し、今後 6 ~ 12 か月以内に、機能不全に陥ったスーパー AI がインターネット全体を乗っ取る可能性が高いことを認めました。

Anthropic 内で、クロードはモデルの研究開発作業の最大 26% を主導してきました。


人間を信頼できないなら、お互いを信頼するしかない

しかし、たとえ署名されたとしても、この協定は制御すべきものを制御することはできません。制限されるのは「商用 API」だけです。

今年の問題はすべて未発売モデルでした。ハギングフェイスにハッキングされたIM1と私が設計したアストラファミリーは契約の範囲外です。これは、隣のクラスの教師に試験の監督を依頼するようなものですが、不正行為をした生徒は試験室にまったくいません。

ブラック ボックス相互テストでは、最終的な異常出力のみを確認できます。システムのプロンプトメッセージや内部の攻撃と防御のログなど、本当に重要なものはすべて機密扱いとなります。

そこで、両家族は新たな一歩を踏み出しました。 Amodei は、第三者の評価者が直接立ち会い、開発環境を完全にオープンにすることを公に約束しました。アルトマン氏は続けて、OpenAIも同様のことを行うだろうと述べた。


過去 5 年間、相互禁止と密猟が多かったこの 5 年間、業界全体で最もお互いを信頼していなかった不倶戴天の敵であるこの 2 人は、制御不能な恐怖に直面した中で信頼できる唯一の同盟者となりました。

彼らは、自ら作成したブラック ボックスをあえて信頼するよりも、自分の切り札を相手に渡したいと考えています。

協定の内情が流出したのと同じ日に、OpenAI は別の公式政策文書を発行し、米国が「再帰的自己改善」に関する世界的な技術ガイドラインの策定で主導権を握るよう求めた。

この文書では、AI は絶対に安全になるまで自己進化を追求すべきではないと述べています。

この文書を作成した会社では、アストラ社が次世代モデルの図面作成に日夜取り組んでいます。

参考資料:

https://www.theinformation.com/articles/openai-anthropic-neared-deal-stress-test-others-ai?rc=epv9gi

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし