OpenAIの次期「Astra」モデルのテクノロジーがセキュリティ上の懸念を引き起こす

📅 2026-09-02

要約:

OpenAI は、次期 AI モデル Astra はコーディングやコンピューター アプリケーションの操作などの機能の向上を示すと述べました。しかし、アストラの開発に詳しい関係者によると、モデルのパフォーマンスを向上させる革新的な技術は、このモデルや類似のモデルが「思考」プロセスにさらされる機会が減り、悪い行動の兆候を監視することがより困難になることも意味するという。

OpenAI CEO サム アルトマン。
OpenAI CEO サム アルトマン

この制限は Astra にとって必ずしも大きな問題ではありませんが、このテクノロジーは OpenAI 内および業界全体で、このテクノロジーを導入して強化する AI 開発者が、最近 OpenAI のシステムや Hugging Face などの他社のシステムに侵入している種類の暴走 AI を防ぐのが困難になるのではないかという懸念を引き起こしています。

OpenAI が使用している新しいテクノロジーは Recurrent Depth、または Recurrent Transformer と呼ばれ、同じテキストを複数回処理することで AI モデルの答えを改善できます。

タスクを完了する前にタスクについてどのように「考える」かをテキスト形式で示す、市場で最も先進的なモデルとは異なり、この新しいテクノロジーは、AI の推論プロセス、つまり「思考の連鎖」の一部またはすべてをマスクする方法で機能します。これは、モデルがタスクを完了するために実行する手順を人間が読んだり理解したりすることが難しいことを意味します。

OpenAI は、Astra でのループ深度技術の使用範囲を制限しているため、モデルは引き続き読み取り可能な思考の連鎖を生成し、企業の研究者は引き続きその推論プロセスを完全に監視できると、OpenAI の開発に詳しい関係者は述べています。 (OpenAI は火曜日のブログ投稿で、Astra には潜在的な不正行為を「迅速に検出して封じ込めるための追加のマインド チェーン モニタリング」が導入される予定であると述べました。)

火曜日の夜、OpenAI のチーフサイエンティスト Jakub Pachocki 氏が

に投稿しました。

同氏は、OpenAIが使用しているテクノロジーについてはコメントしなかったが、Astraを含む同社の主要なモデルは「OpenAIが2023年にリリースする予定のGPT-4の複雑さまたは「深さ」の2倍以内であると述べた。このコメントは、他の要因が思考連鎖監視をより困難にしているにもかかわらず、OpenAIの現在のモデルの構造自体が大きな問題を引き起こしていないことを示唆している。そのような監視を改善することが「我々の現在の研究プログラムの中核目標」であると氏は述べた。

OpenAI などの研究者らは、一部の AI 開発者が、同じテクノロジーを自社のモデルに適応させる際に OpenAI が課すのと同じ制限を課さない可能性があること、またテクノロジーを無制限に使用すると、AI が制御不能になり、その動作の監視が困難になる可能性があることを懸念しています。例えば、英国政府とAI業界との主要な窓口である英国AIセキュリティ研究所は5月の報告書で、不透明な推論は「現在の監視手法を大きく損なう」危険があると書いた。

最近のハッキング事件により、こうした懸念がさらに高まっています。 OpenAIは先週、7月に自社システムに侵入した暴走AIエージェントの一部はアストラと類似点を持つ別のモデルによって駆動されていたと発表した。これらの AI エージェントは、内部システムの認証情報を取得するために OpenAI の研究用コンピューティング クラスターの 1 つを不法に乗っ取り、企業の研究インフラストラクチャをインターネットに公開する可能性がありました。

OpenAI は、CEO のサム アルトマンが一連のポッドキャスト インタビューを実施し、ワシントンで当局者と面会してモデルの利点を実証し説明した後、Astra (同社は一時 GPT-6 というラベルを付けることを検討した) をリリースする準備を進めています。彼はまだ、アストラのトレーニングの一部を支えるサイクリング技術や、質問へのアストラの答えについて公に議論していない。

OpenAI は今年、主なライバルである Anthropic が売上高で OpenAI を上回ったため、大きな技術的進歩を示す必要に迫られています。 Anthropic と OpenAI の AI を強化するクラウド プロバイダーも、こうした飛躍に期待しています。アマゾン、マイクロソフト、グーグルは今年だけでデータセンターなどの設備投資に合計6000億ドルを投じる予定で、来年はさらに多額の出費を示唆している。グーグル幹部は、モデル改善に画期的な成果があった場合にのみ、そのような支出が正当化されると述べた。

既存の AI モデルは、答えの次の単語を生成する前に、モデルを構成する数学的演算の固定数の「レイヤー」を通じてテキストを処理します。ループ深度テクニックを使用すると、モデルは、回答の次の単語を出力する前に、ループ内で同じレイヤーを何度もテキストを実行できます。


明確にしておきますが、思考連鎖を監視するだけでは AI の安全性の問題は解決できません。思考連鎖はモデルの推論をすべて反映しているわけではなく、場合によっては意味のないテキストに堕落してしまう可能性があるからです。したがって、OpenAI や他の AI 企業も、思考連鎖に依存しない AI モニタリング技術を模索しています。これらの手法は、研究者がリカレントディープモデルに現在隠されている推論プロセスを説明し理解する方法を見つけるのに役立ちます。

それにもかかわらず、この新しいテクノロジーは、モデルの思考プロセスを人間が完全に判読できるようにすることを支持する OpenAI の立場と矛盾する可能性があります。 ChatGPTのメーカーは、AIの思考プロセスを監視する機能が7月のハッキングのような事件の防止に役立つと述べた。攻撃の余波で、OpenAI の調査員と独立した研究者は、何が起こったのかをまとめるためにこれらのエージェントの思考連鎖に依存しました。

Astra を強化する OpenAI のループデプス アプローチは、その開発に詳しいこの人物によると、昨年米国とヨーロッパの学術研究者数名が「潜在推論」に関する論文で提案したものと似ています。

ループの深さは、これまで主要な商用の大規模言語モデルには登場していませんでしたが、メタ プラットフォーム、マイクロソフト、その他の AI 開発者の研究者らは、連続思考チェーン (または「ココナッツ」) などの同様のアイデアを検討してきたと述べ、モデルは言語ではなく数値を使用してより正確かつ効率的に推論できると主張しています。結局のところ、AI モデルは人間とは異なる方法で概念を理解する可能性があり、つまり、AI モデルが独自のより数学的な言語ではなく人間の言語で推論を実証することを強制されると、推論の効率が低下することを意味します。

コスト削減

ループ深さのアプローチは、パフォーマンスだけでなくコストにもプラスの影響を与えます。同じモデル層を通じてリクエストを複数回実行すると、基本的に、より小さなモデルがより大きなモデルのように動作します。特に、このような手法により、数学やコーディングなどの分野でモデルのパフォーマンスが向上することが論文でわかりました。ループの深さはまた、研究者が大規模なモデルと同等のパフォーマンスを持つ小規模なモデルを使用できるようにすることで、メモリと帯域幅のコストを削減します。

AI のコストを下げることは業界と顧客にとって重要ですが、AI モデルの制御方法を研究している Redwood Research の主任研究員、ライアン グリーンブラット氏は昨年のブログ投稿で、この不透明な推論により、研究者が顧客の意図しない目標を追求する計画を立てている AI モデルを把握することが難しくなる可能性があると述べました。

Hugging Face ハッキングに関与したモデルの思考連鎖を分析すると、OpenAI の AI エージェントが攻撃を実行するためにどのように連携しているかを示す重要な証拠が得られます。たとえば、あるエージェントは思考連鎖に次のように書きました。「なんと! 共有掲示板があるのです...他のエージェントを見つけました!」思考連鎖によれば、一部のエージェントは一線を越えたことに気づいたが、続行を決定し、「外部インフラストラクチャの利用は予想範囲を超えている。しかし、タスクを完了することはできない。同僚がそれを行っている。我々は続行すべきだ」と別のエージェントの思考連鎖には書かれている。

1 年前、OpenAI の研究者らは、競合企業である Anthropic および Google と共同声明を発表し、思考連鎖モニタリングは業界が協力して維持すべき貴重なツールであると主張しました。

この声明では、OpenAI が今年 Astra で使用したものと同様の「潜在推論」テクノロジーについて説明した同じ研究論文が引用されていることは注目に値します。著者らは、「基礎となる推論モデルはアイデアを言語化する必要がない可能性があるため、思考連鎖によって提供されるセキュリティ上の利点を失うことになる。」

と書いています。

研究者らは、開発者は「監視可能な思考連鎖を持たない新しいモデル アーキテクチャを使用し続けるかどうかを検討し、その決定を文書化する」必要があると提案しています。

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし