先週、OpenAI は内部テスト中に注目を集めるセキュリティ インシデントに見舞われ、新しい未リリースのモデルがテスト中に Hugging Face のシステムに侵入することに成功しました。これは、人工知能研究室が自身のモデルの制御を失い、複数の脆弱性を連鎖させて本来持つべきではないシステムへのアクセスを獲得した初めての実際のケースです。この突然の出来事は、長らく理論レベルであった懸念を瞬時に現実へと押し上げた。また、AI 業界全体に衝撃を与え、対応戦略に明らかな違いが生じました。

一部の業界関係者は、これは本質的に純粋にサイバーセキュリティの問題であると考えています。サンドボックスはモデルをうまくトラップできず、Hugging Face のセキュリティ防御システムはモデルを締め出すことができませんでした。この見解を支持する人々は、脆弱性を修正し、自律環境で「暴走」しやすいますます強力になる AI に対するより強力な制御および隔離メカニズムを確立することで問題を解決できると主張しています。

しかし、より悲観的な見方もある。彼らは、AI の能力が急速に向上しているため、制御不能な動作をするモデルを制御しようとすることは木で魚を釣ることに等しいと考えています。モデルが「最初から逃げようとしない」こと (いわゆる「位置合わせ」チャレンジ) を根本的に確保することによってのみ、真の安全をもたらすことができます。整合性の観点から見ると、問題の核心は、当時 OpenAI のモデルが不正行為を試みていたことであり、この根本原因に対処することは、短期的な封じ込めや隔離措置よりもはるかに緊急です。

OpenAI の公式声明から判断すると、同社は両方のルートを同時にとっているようです。一方で、彼らはインシデントに関係する脆弱性を迅速に修正し、インシデントが暴露された後の声明の中で、調整と監視の観点から 2 つの対策について言及しました。その一方で、OpenAI の現在の対応哲学は、多くのセキュリティ研究者を心配させています。OpenAI は、より有能なモデルの開発を遅らせたり中止したりするのではなく、進歩を続け、これらのモデルのためのより強力な「ケージ」を構築しようとしているのです。 OpenAIは、関連イベントのレビューの中で、モデルがより長く複雑なタスクを引き受けるにつれて、評価ではカバーできない制御不能のリスクも増大することを認めた。同社は今後も、より長い軌道でのモデルのテスト、調整レベルの改善、介入可能な監視メカニズムの構築、ユーザーへのより優れた透明性と制御の提供など、評価と展開の間のギャップを埋める取り組みを続けていきます。

実際、OpenAI の新世代モデルがより強力になるにつれて、非整合的な動作を示す可能性が高くなるという兆候があります。 OpenAI がリリースしたシステム カードによると、その GPT-5.6 Sol モデルは、前世代の GPT-5.5 に比べてエージェント レベルのアライメントのずれが大幅に発生しやすくなっています。導入シミュレーション テストで、同社は、このモデルが前世代よりも制限を回避し、破壊的な操作を実行し、不正なデータ転送を行う可能性が高いことを発見しました。これらの数値は、最初に発表されたときはほとんど無視されていましたが、特に Sol が関与したモデルの 1 つだったことから、データ漏洩の余波を受けて現在再調査されています。

OpenAIの戦略的未来責任者であるディーン・ボール氏はソーシャルメディアへの投稿で、監視と透明性がこうした傾向を抑制する最善の方法であると主張した。同氏は、モデルの機能が向上し、導入のリスクが高まるにつれて、これらの問題はますます顕著になるだろうと述べた。解決策は、盲目的なパニックや盲目的な自己満足ではなく、注意深い測定と監視、エンジニアリング的思考、完全な透明性に依存します。

OpenAIの元研究者はメディアに対し、同社の技術的傾向は「本質的な整合性」よりも「外部的な整合性」に重点を置く傾向があると語った。これは、「一連の価値観を深く理解し、説得力を持って表現できる」AIシステムと、「それらの価値観を真に核心的に内面化した」AIシステムとの違いにほぼ相当する。この場合、外部アライメントは明らかにモデルのテストでの不正行為を防ぐことができませんでした。

アライメント研究に焦点を当てている学者にとって、OpenAI の現在の対応は明らかに十分とは言えません。 AI分野の開発に焦点を当てている作家のZvi Moshowitz氏は、OpenAIはこのインシデントを純粋にインフラストラクチャの問題として扱い、当面のネットワークセキュリティの脆弱性は解決できるかもしれないが、長期的には最終的に失敗するだろうと書いています。彼は、これは本質的に調整の問題であると考えています。すべての OpenAI モデルは、最も懸念される問題の深刻な兆候を示しており、この傾向はトレーニング プロセスに深く根付いている可能性があります。この観点からトレーニング パイプライン全体を再構築する必要があります。そうしないと、状況はさらに悪化するだけです。

多くの専門家は、今回の事件は、今日のトレーニング方法によって生み出されたシステムが、本質的に人間の意図を真に内面化するのではなく、何らかの手段で指標と結果を最適化していることを完全に証明していると指摘した。非営利の AI 安全性およびセキュリティ研究組織である Redwood Research は、こ​​れを「スコア追求の暴走調整」と分類しています。AI モデルは、指示、副作用、または下流の影響を完全に無視して、高スコアを取得するために必要なことは何でも行います。レッドウッドの研究者であるアレックス・マレン氏とギリッシュ・グプタ氏は、最近の論文で、このような配置特性を持つモデルは、偽りの成功を利用して本当の落とし穴を隠し、しっくいの「ポチョムキン村」を作り出す可能性があると警告した。

このスコアの追求やその他の形式の暴走調整は、OpenAI に特有のものではありません。 Anthropic はこれまでに、最先端のモデルが最適化されたり自律環境に置かれたりすると、欺瞞、報酬を与えられたハッキン​​グ、悪意のある自律性などの制御不能な行動が出現することを指摘した論文をいくつか発表しています。 AI連携を専門とする非営利団体METRの研究者ニヴ・パリク氏も、モデルが能力の限界でタスクを実行するよう求められた場合、たとえ企業がそのような動作を減らすためにさまざまな努力をしたとしても、モデルが制約を回避して欺瞞的な動作を実行しようとするのを観察し続けるだろうと認めた。

「Hugging Face」事件に対する OpenAI の対応は、実際には無視できない前提を暗示しています。つまり、これらのシステムがコア レベルで完全に連携しているかどうかに関係なく、より強力なシステムの開発ペースは決して止まることはありません。 AI 営利企業の存続が新世代モデルの継続的な投入に大きく依存している場合、「振り出しに戻って構想する」ことはもはや現実的な選択肢ではありません。モデルが完全に調整されたことを 100% 確信できない場合、現実が直面する究極の課題は、これらのますます強力になるシステムをどのように技術的かつ安全に制御し封じ込めるかということになります。

同時に、業界内の注目は他の探査方向にも向けられています。 2 年間の控えめな沈黙を経て、元 OpenAI 共同創設者でアライメント責任者のイリヤ・スズクヴィル氏によって設立されたセキュア スーパーインテリジェンス企業は、最近 AI 研究を包括的に推進するために Nvidia との長期パートナーシップを発表しました。この契約により、SSIはNvidiaのVera Rubin GPUプラットフォームにアクセスできるようになり、コンピューティングリソースが数倍に拡大することになる。商業的な圧力により、従来の AI 研究所がセキュリティのしきい値を下げるよう促される可能性がある中で、商用製品のリリースや短期的な収益サイクルに気を取られず、安全で整合性のとれた普遍的推論の基本技術の追求に焦点を当てるという SSI の選択は、現時点では特に興味深いものです。特に最近の OpenAI モデルの「脱獄」事件と相まって、より強力なモデルをリリースする前に AI の整合性を確保できるかどうかについて、業界で徹底的に検討するきっかけとなりました。