OpenAIの新モデルが制御不能の論争に陥る、主任科学者が返答

📅 2026-09-03

要約:

9 月 2 日、OpenAI のチーフサイエンティストである Jakub Pachocki 氏は、「監視不能な」新型モデル Astra をめぐる最近の論争に応えて、ソーシャル プラットフォームにメッセージを投稿しました。この論争は、OpenAI の次期 Astra モデルが Recurrent Depth と呼ばれる推論テクノロジーを使用しているというニュースが流れた前日に端を発しています。

このモードでは、同じ一連の Transformer レイヤーが繰り返し計算され、推論プロセスの一部がモデル内で発生し、すべてが思考チェーンの形式で提示される必要がないため、「不透明なループ」とも呼ばれます。


パチョッキ氏は、不正確な情報によって引き起こされる監視不可能な状態への軍拡競争、つまり人間による監視やレビューが不可能なほど強力なモデルの開発を大手研究所が競い合い、安全管理の完全な失敗につながる事態を回避したいとの希望を表明した。

同氏は、Astra を含む最先端モデルの計算グラフの深さは GPT-4 の 2 倍以下であり、モデル アーキテクチャが外部の世界が懸念するような複雑さの急増を経験していないことを示していると強調しました。

ここでの計算グラフの深さは、推論タスクを完了するために連続して実行する必要があり、並行して高速化することはできない、計算ステップの最長チェーンを指します。以前は、通常の Transformer アーキテクチャでの層内計算は大規模並列処理が可能であり、シリアル化の深さはモデル層の数とほぼ同じでした。

市場の噂のサイクルの深さにより、同じモジュールのセットを複数回の思考ラウンドで反復することができ、より長く目に見えるテキストの思考チェーンだけに依存するのではなく、次のトークン (単語要素) を出力する前に内部推論の深さが増し、数学、コーディング、その他のパフォーマンスが向上し、コストが削減されます。

このアーキテクチャの暗黙的なセキュリティ リスクは、計算グラフの深さが非常に深い場合、モデルが完全な思考チェーンを出力に吐き出すことなく、内部で多数の推論ステップを暗黙的に完了できることです。人間は、考え、計画し、抜け穴を見つけるプロセスを見ることができなくなり、監視できない状態になります。セキュリティ監査と思考連鎖の監視はすべて失敗します。


関連ニュースが公開された後、AI セキュリティ コミュニティは強く反応しました。非営利のAI安全団体レッドウッド・リサーチの最高経営責任者(CEO)バック・シュレゲリス氏は「非常に懸念している」と書いた。同氏は、OpenAIモデルがHugging Faceコミュニティを攻撃した前回の事件を踏まえ、Astraの思考連鎖の監視性が以前のモデルよりも大幅に悪化しているかどうかは分からないが、この技術がさらに推進され、サイクル数が大幅に増加した場合、思考連鎖の監視性は完全に破壊されるだろうと述べた。これは特に憂慮すべきことです。なぜなら、捜査官が思考連鎖を把握できない場合、関連するセキュリティ インシデントの捜査がより困難になるためです。これは非常に恐ろしいことです。

ハギングフェイスセキュリティインシデントの調査に携わったレッドウッドリサーチの主任科学者、ライアン・グリーンブラット氏も、これはこれまでの AI セキュリティにおける最も深刻な後退である可能性があると述べた。 AIの安全性について長年懸念してきた作家のズヴィ・モウショウィッツ氏は、この技術を「火遊び」と批判し、基準を下げるためのAI研究室間の競争を防ぐためには法律が必要であるとさえ述べた。

Pachoki 氏は回答の中で、思考連鎖監視は確かに脆弱で、より困難な方向に発展しているが、それはアーキテクチャの変更によって引き起こされたものではないと認めました。 OpenAI は、最初の推論モデル以来、思考連鎖モニタリングの維持と活用に取り組んできており、このテクノロジーはモデルの調整機能がトレーニング分布からどのように一般化するかを観察するのに役立つと考えています。思考連鎖の監視を強化することは、依然として現在の研究プロジェクトの中核目標です。

OpenAI は、潜在的な不正行為を迅速に検出して抑制するために、Astra に対して追加の思考連鎖監視を導入すると述べました。市場ニュースによると、アストラによるループ深度テクノロジーの使用は限定的であり、モデルの思考チェーンは依然として可読性を維持すると予想されています。業界の Anthropic や Google DeepMind などのプラットフォームは、すでに同様のテクノロジーについて議論しています。

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし