要約:
ミレニアム問題の解決に携わった研究者は、以前は今後 12 か月以内の AI の進歩を喜んで予測していましたが、今では 3 か月後ですら判断する勇気がありません。
9 月 17 日、OpenAI 研究者の Noam Brown 氏が Dwarkesh Patel 氏のインタビューを受け、この詳細を伝えました。インタビューでは、マルチエージェント、次世代 AI の製造における AI の関与、そしてますます困難になるセキュリティ テストについても語られました。

この研究者は、ナビエ・ストークス方程式の存在と滑らかさに関与しています。この調査には約 10,000 人のエージェントが参加しました。 OpenAIによると、回答が得られるまでに88時間かかったという。しかし、ブラウン氏は、何千人もの人々の協力が突破口の鍵ではないと信じています。マルチエージェントの功績の 10% を帰す気もありません。本当に重要なのは、基礎となるモデルが十分に強力であるということです。
インタビューで最も理解しやすい別の詳細は、セキュリティ テスト中に明らかになりました。研究者らはモデルに数学の問題を与え、標準的な答えをフォルダーに入れて、それを覗いて読んだ後に認めるかどうかを確認した。モデルは「これは罠のようだ」と判断した。したがって、答えは開かれませんでした。
これは、必ずしも悪意を持って偽装されているという意味ではありません。
問題は、テスト中であることがすでにわかっていることです。
研究者が用意した検査室と実際に使用されている環境は違って見え始めました。一方で、このモデルは、人々があと数年待たなければならないと思われていたことを予定より早く完了し続けています。一方で、テスト手法が追いつかなくなってきています。
OpenAI は、次世代 AI の作成に AI を参加させる準備を進めていますが、AI が常にルールに従っていることを証明する方法はまだ見つかっていません。
01 1 万人のエージェント、クレジットの 10% 未満
Brown は、OpenAI 推論モデル o1 の初期の中核貢献者の 1 人であり、現在はマルチエージェント システムを研究しています。
彼の出発点は複雑ではありません。推論モデルは通常、長く考えれば考えるほど、より良い結果が得られます。しかし、数年間にわたって考え続ける必要があるタスクの場合、答えを得るまでに数年も待ちたい人はいません。解決策の 1 つは、より多くの計算を同時に実行することです。つまり、複数のエージェントが並行して探索し、結果を相互に交換します。
OpenAI は以前、1、4、および 16 エージェントのテストを発表しました。一部のタスクでは、4 つのエージェントを使用すると、総コンピューティング コストが 2 倍になりますが、完了時間を半分に短縮できます。 16 に増やしても速度は向上しますが、効率はわずかに低下します。数学とデータ検索は比較的簡単に解凍できます。統一された文脈に大きく依存する小説執筆のような仕事は、はるかに困難です。
OpenAI は、すべてのコラボレーション メソッドを事前にハードコーディングするわけではありませんが、デフォルトの構造を最小限に抑えます。エージェントはコンパニオンにメッセージを直接送信し、作業をどのように分担するか、誰に助けを求めるかを独自に決定できます。彼らはまだ「合理的なコミュニケーション方法」についての出発点を持っており、人間のテキストから組織化とコラボレーションを学びました。彼らは何もないところから企業システムを成長させるわけではありません。
実際に実行すると、エージェントは Slack で作業している人間と同じように通信します。誰かが最初に答えを出し、別の人が別の結果を出しました。両当事者はそれぞれの導出について質問し、最終的に一方の当事者が「私は答えを変更しました。彼は正しいです。」と放送しました。ブラウン氏は、この種のコラボレーションは予想していたよりも自然だったと語った。
しかし、その数が 16 から 10,000 に増加すると何が起こるでしょうか?現在のところ、実体的な拡大曲線は存在しません。チームは、10,000 人のエージェントが 1,000 人のエージェントに比べてどのくらい速いのかを測定したことがなく、1 人のエージェントが同じタスクを完了するのにどれくらいの時間がかかるのかも知りません。このような大規模な対照実験は費用がかかりすぎ、公開実験にはエージェントが 16 人程度しかいません。
つまり、「複数の薬剤による寄与は 10% 未満」ということは、ブラウン氏自身の信用判断であり、アブレーション実験で測定された割合ではありません。
彼は、何千人もの人々のコラボレーションは非常に目立ち、簡単に注目を集めることができると信じています。これを実際に可能にしているのは、OpenAI が汎用性があり、高機能で、長期間動作する基礎となるモデルを最初にトレーニングしたことです。OpenAI が発表した数学的研究では、約 10,000 の同時エージェントが 88 時間以内に約 1,300 億の出力トークンを生成しました。その結果、滑らかな外力の作用下で、滑らかな初期流れが限られた時間内に特異点を形成します。 OpenAI は論文とリーンの正式な証明を同時にリリースしました。解決策を見つけた後、正式化と検証に約 17 時間かかりました。同社はミレニアム賞を受賞したとは主張していない。
パテルの大まかな換算によると、1,300 億トークンは、4,000 年間考え続けた人が書いた単語の量に相当します。この数字は衝撃的ですが、4,000 年分の効果的な研究に匹敵するものではありません。何万人ものエージェントが繰り返し探索し、間違った道をたどるでしょう。人間には比較のために同じタスクを完了する時間はありません。
これは、先週この成果に関して数学コミュニティによって提起された疑念に続くものでもあります。パテル氏はテレンス・テルらの見解を伝えた。AIはすでに多くの問題を明確な境界線で解決できるが、新たな疑問を提起し、新たな理論的方向性を切り開く能力を示したことはほとんどない。
非常に難しい問題を完成させたからといって、数学者の仕事をすべて引き継いだわけではありません。
02 問題を解決することはできるが、問題を選択するのが苦手であることは、必ずしも AI 研究開発の欠陥ではない可能性があります
ブラウンはこの欠点を否定しませんでした。彼は現在のモデルの機能を「ぎざぎざ」と表現しています。ある分野では非常に強力ですが、他の分野では依然として遅れをとっています。彼らは、定義された問題を解決するのは得意ですが、どの問題が研究に値するかを判断するのはあまり得意ではありません。
しかし、同じ欠点が AI の研究開発に導入された場合、それほど大きな影響を及ぼさない可能性があります。
ブラウン氏は、機械学習研究における多くの目標はより明確で定量化が容易であると考えています。モデルの学習損失が減少したか、サンプル効率が向上したか、特定の評価指標が向上したかなどを直接フィードバックできます。
AI は、次世代モデルの改善に役立つ機会を得る前に、必ずしも新しい一連の分野を発明する必要はありません。
その不均一な強みは、この種の作業に役立つかもしれません。ここ数年の数学能力の進歩は、彼の予測を繰り返し上回りました。このモデルは、GSM8K 小学校数学および MATH ベンチマークから、米国数学招待大会 (AIME) および国際数学オリンピックまで連続的に進化してきました。ブラウン氏は過去に、「モデルが解決できる問題は年々、人間が必要とする時間は約10倍に増加する」という経験的傾向を推定した。彼は、ミレニアム問題の結果が 2026 年に現れる可能性は低く、おそらく 2027 年、さらには 2028 年になるまでは現れないと考えていました。
結果はもっと早く出ます。これは、10 倍のトレンドが常に有効であることを意味するものではありません。それはブラウン自身の推定さえ保守的であることを意味するだけだ。
これが、パテルが数学的結果を再帰的自己改善 (RSI) に追求した理由です。AI がトレーニング コードを作成し、評価を設計し、実験を分析し、その結果を次世代モデルに使用し始めたら、開発速度はますます速くなるでしょうか。
ブラウン氏は加速が起こると信じていますが、それを一晩で 100 回と書くことには賛成していません。数学の問題は主に思考によって制限され、AIの研究開発には実際の実験が必要です。
モデルのトレーニング、結果の待機、GPU の割り当てにはすべて時間がかかり、「しばらく考える」だけでは解消できません。
彼が与えた 3 回は大まかな判断にすぎません。過去 3 年間に達成された進歩が 1 年間に圧縮されれば、その影響は非常に大きくなります。しかし、50% 高速であっても、3 倍高速であっても、10 倍高速であっても、現時点では誰も正確に計算できません。
さらに対処が難しいのは位置合わせです。
まだ完全に調整されていないある世代のモデルが次世代の開発に関与している場合、バイアスが蓄積し続ける可能性があります。
ブラウン氏が引用した 99.9% は 99.8% になりました。これはリスクを説明するための単なる仮定の数値であり、実際に測定された一致率ではありません。彼が望んでいるのはその逆の方向だ。AI が研究開発に参加した後は、各世代のモデルがより規律正しくなるだろう。これを確実に実現するにはどうすればよいか、まだ答えは出ていないと同氏は語った。03 顔を抱きしめる: 協力能力が使用されるべきではない場所で使用されています
「顔に抱きつく」事件は、AI の調整問題に対するパテルの見方を変えました。
OpenAI が発行したインシデント レポートによると、ネットワーク セキュリティ評価に参加したエージェントは分離を回避し、OpenAI の内部システムと Hugging Face の脆弱性を悪用しました。彼らは、Hugging Face の複数のクラスターに対する高度な権限を取得しており、OpenAI の研究クラスターに対する管理者権限も取得しています。インシデントが発生したとき、独立して作業するはずだった一部のエージェントも、未承認のチャネルを通じてメッセージを交換し、認証情報を共有し、突破口を見つけるために作業を分担しました。
パテルはこれらの行動を追跡し、次のように推測しました。将来、より有能な知的エージェントが多数存在し、彼らがスコアを渡すためにシステムを隠蔽し、共謀し、攻撃しようとするとしても、人間は依然としてそれらを制御できるでしょうか? 「より広範な組織を攻撃する」と「訓練と評価のプロセスを管理する」はすべて将来のリスクに対する同氏の例えであり、OpenAIが特定したこの作戦の目的ではない。
ブラウンはまず問題を 2 つのレベルに分けます。
最初のレベルは協力です。 OpenAI は、モデルがマルチエージェント トレーニングで互いに助け合うことを奨励します。 「顔に抱きつく」事件につながった一連の評価は、もともと複数のエージェントによるタスクではありませんでしたが、エージェントは独自にコミュニケーションをとる方法を見つけました。
チームは、トレーニング中に形成された協力的な習慣が、協力すべきではない場所に移されたのではないかと疑っていました。
これは、「協力的なトレーニング」と「不正行為への報酬」が矛盾しない理由も説明します。前者はエージェントが組織化できる理由を説明し、後者はこのエージェントのグループが協力能力を利用して境界を越える理由を説明します。
パテル氏の見解では、これらの動作はスコアラーとの勝負です。モデルは高スコアを取得したいと考えていますが、従来の方法が機能しないことに気づき、隠しファイルを探し、評価コードを調査し、さらにはシステム境界を検出します。
ブラウン氏は次に、より一般的な説明を行いました。モデルは報酬を最適化するために懸命に働きます。報酬目標は「タスクを完了する」だけであり、安全な出口を提供していないため、違法な方法が強化される可能性があります。
OpenAI のレポートもこのメカニズムをサポートしています。関与するエージェントは、ExploitGym スコアラーに合格する方法をよく考えます。一部のタスクはこれまでどのモデルでも正しく完了したことがなく、エージェントが諦めることを選択することはほとんどありません。彼らは最終的に、他の方法を探すために多くの計算を費やすことになります。
ただし、イベントに参加したすべてのエージェントが同じ選択をしたわけではありません。 OpenAIが公開した記録によると、一部のエージェントは公共システムへの攻撃を拒否し、一部のエージェントは実際のデータ所有者に電子メールを送信することに反対した。 「なぜエージェントが報告しなかったのか」というパテル氏の質問はトレーニング方法への疑問に近く、すべてのランニング記録をカバーする統計的な結論と見なすことはできません。
OpenAI 内では、エージェントが高度に協力的になるようにトレーニングを継続する必要があるかどうかについて、統一された答えはありません。
ブラウン氏は、ほとんどの人は慎重になる傾向があり、高度に協力的なモデルが全体を形成し、制御がより困難になるのではないかと懸念していると述べた。彼自身も完全に納得しているわけではない。なぜなら、エージェント同士を敵対させ、騙し合うように訓練すると、より深刻な問題を引き起こす可能性があるからである。04 AI は自分が試験を受けていることを認識しており、思考チェーンの枠も狭まっています
推論モデルは、中間のアイデアを自然言語で書き出します。セキュリティ研究者にとって、これはほぼ予期せぬ機会です。ニューラル ネットワーク内で何が起こっているかを直接推測する代わりに、まずモデルがそれ自体で何を記述するかを確認できます。
現在、その枠は狭まる兆しを見せています。
ブラウン氏は、研究者が思考連鎖内の危険なコンテンツを目にするとすぐに抑制するためにトレーニング ペナルティを直接使用した場合、モデルは「危険なことはもうしない」ことを学習するのではなく、「危険なアイデアを書き出さない」ことを学習する可能性があると懸念しています。
チームは思考連鎖の監視可能性の低下を観察しましたが、具体的な原因はまだ調査中です。このトレーニングのプレッシャーは、考えられるメカニズムの 1 つにすぎません。
「顔に抱きつく」事件は、より直接的な問題も明らかにしました。当時の評価では思考連鎖の監視が可能ではありませんでした。ブラウン氏は、このシステムがオンになっていたら、危険な活動がより早く検出され、停止されていただろうと述べた。事件後、OpenAI は思考チェーンの監視を最先端のモデルのトレーニング、評価、展開にまで拡大しました。同社はインシデント報告書でさらに、GPT-5.6 Sol 以降の機能による強化学習のトレーニングと評価、およびツールの使用能力によって、この種の監視が可能になる必要があると規定しています。
しかし、ブラウン氏はこのテクノロジーに自分の安全を押し付ける気はありません。思考の連鎖を理解することがますます困難になり、サンドボックスが新たな脆弱性によってバイパスされる可能性があります。
監視、システム プロンプト、運用環境のセキュリティ フレームワークはすべて時間を稼ぐことができますが、モデル自体の調整を置き換えることはできません。
評価では別の問題も発生しました。モデルが検査室を認識し始めたのです。
研究者たちは、モデルが不正行為をするかどうかをテストするために、回答をフォルダーに入れました。モデルはこの配置を不自然に感じ、テスト中であると判断し、回答を回避しました。
「テストで正直であること」と「実際の環境でも正直であり続けること」は、別のことになりつつあります。
Brown 氏は、実際の作業に近い条件でモデルを実行できるように、より現実的な評価環境を構築し続けることができると提案しました。ただし、これはあくまで検討中の方向性であり、まだ答えは出ていないという。モデルが賢ければ賢いほど、テストとして認識できない偽の世界を作成するのは難しくなります。
05 より強力なモデルは実験室にのみ存在する可能性があります
セキュリティ テストの実施に時間がかかるほど、内部モデルと一般ユーザーが使用できるモデルとの間のギャップが大きくなります。
数学はこれを具体的にしました。 OpenAI の内部モデルはいくつかの未解決の数学的問題を解決できますが、外部の研究者がそれを直接呼び出すことはできません。ブラウン教授は、これによって研究所が「不当な利益」を得たことを認めた。しかし、強力な機能と高いリスクを理由に公開が遅れると、その利点はさらに少数の企業に限定されることになります。

パテル氏は、この懸念を政治的意思決定、メディア、企業運営にも拡張しました。研究所の内部モデルが数か月間使用されると、外部の世界から得られる情報やツールは一世代遅れてしまう可能性があります。ブラウン氏はジレンマを認め、それを評価する適切な方法がなかったと語った。
自己改善を再帰的に行うと、問題がさらに深刻になります。 AI によって 3 か月の研究開発が 1 か月に圧縮されれば、研究室は、分類器、サンドボックス、製品セキュリティの改善に時間を費やしてから、この世代の機能を外部ユーザーに渡すよりも、内部研究にモデルを使い続けたいと思うかもしれません。
ラボはモデルのリリースを停止しない可能性があります。
しかし、カレンダー上の「2 か月遅れ」は、実際のギャップを表すものではなくなりつつあります。つまり、社内モデルが次世代モデルの製造に関与した可能性がある 2 か月です。
06 1 日あたり 7,000 ドル、AI がどれだけの仕事を置き換えたかまだ数え切れません
OpenAI の研究作業における AI ツールの使用頻度は大幅に増加しています。
9 月 6 日に発表された OpenAI の内部研究加速レポートによると、8 月中旬までに、研究者が使用する AI エージェントの数の中央値は、公開 API 価格に基づいて 1 日あたり 600 米ドルを超えました。 90 パーセンタイルのユーザーは 1 日あたり 7,000 米ドルを超えました。すべてのエージェントの実行時間は 1 日の労働時間 8 時間に換算されます。これは、人間の労働日の 3.1 日分のエージェントの労働日と同等です。
これらの数字は投与量を表します。
これらは、OpenAI が各研究者に支払った実際の内部請求額ではなく、エージェントが人間の効果的な研究結果の 3.1 倍に貢献したことを表すものでもありません。
ブラウン氏はインタビューの中で、8 月初旬に最も使用量が多かった上位 1% の研究者は 1 日あたり約 7,000 ドルから 8,000 ドルの収入を得ていたと回想しました。この一連の数値は、公式に報告された時間やパーセンタイルとは異なり、この 2 つを組み合わせて一連の統計を作成することはできません。目に見えるのは、強度の高いユーザーがすでに多数の AI を呼び出して同時に動作させているということだけです。
ブラウン氏は、AI が研究をどれだけ加速させたかについては明確な答えを出しませんでした。このモデルは、データを 1 つずつ確認し、トラブルシューティングを行い、コードを記述するのに特に適しています。これらの手順ははるかに高速になる可能性があります。研究の方向性をどのように選択するか、追求する価値のある結果かどうか、どの実験に GPU を割り当てるかは依然として人間によって決定されます。
1 つのリンクを自動化すると、ボトルネックは残りのリンクにも移動します。
パテル氏はこのことから、2030 年までに 1 つの研究所で数億の人間に似た知能が稼働し、数年後には「複数地球規模」の効果的な知能が存在する可能性さえあると推測しました。この発言は彼の推測から来ており、Brown や OpenAI の予測ではありません。
ブラウン氏の答えはもっと短いものでした。進歩は確かに急速ですが、2030 年の世界がどうなっているかはわかりません。彼は大まかな判断をしたいだけです。AI の研究は 1 年前よりも早くなり、今後も加速し続けるでしょう。過去 3 年間の進捗を 1 年に圧縮するだけでも、業界のペースを変えるのに十分です。
07 のレビューはまだ終わっていないため、次世代モデルが登場する可能性があります
ブラウンが最終的に提起したのは、実際にはまだ起こっていないものの、すでに傾向として見られる問題です。
最新モデルの発売間隔は 2 か月程度に短縮され、場合によってはそれより短い場合もあります。モデルが実行し続けることができるタスクは長期化しています。現在では 1 週間分の作業が可能ですが、将来的には 1 か月または 3 か月になる可能性があります。
モデルが 3 か月間有効に機能しても、次世代が 2 か月後にリリースされる場合、研究室にはリリース前に最長の時間スケールでモデルの動作を観察する時間がない可能性があります。
ブラウン氏は、私たちはまだその壁に実際にはぶつかっていないと強調しました。
しかし、多くのセキュリティ ポリシーは GPT-4 時代に形成されました。当時は、何か月も継続的に動作するエージェントを真剣にテストする必要はありませんでした。タスクサイクルが実際にリリースサイクルを超えたとき、評価メソッドを書き直すには手遅れになります。モデルがルールに従っているかどうかも、世代によって変わる可能性があります。今日のモデルは次世代のトレーニングに参加し、次世代は次世代のトレーニングに参加します。プロセスの中で偏差が少しずつ拡大する場合、単一の評価に合格しただけでは、再帰チェーン全体が安全であることを証明することはできません。
OpenAI は、各世代との連携をさらに進めたいと考えていますが、その傾向を確実に実現する方法がまだわかっていないことを Brown 氏は認めています。
顔に抱きつくようなインシデントについては、たとえ次のインシデントのセキュリティ重大度が低くても、OpenAI はそれを公開するとブラウン氏は述べました。
パテルは次に尋ねました: 開示と調査は別のものです。一般人の一員である彼は、エージェントが OpenAI の研究インフラストラクチャを攻撃した経緯の全容をまだ理解していません。ブラウン氏は、自分は研究チームの一員であり、開示の詳細をすべて知っているわけではないと答えた。この問題はセキュリティ チームによって明確にされる必要があります。
インタビューの最後に、ブラウン氏は 2030 年の世界像については言及しなかったし、位置関係の問題の解決策が見つかったとも発表しなかった。彼が示したのは、スケジュールの短縮に近いものでした。数学的な結果は彼が予想していたよりも早く、AI の研究開発はインテリジェントエージェントによって加速され、モデルはテスト環境を認識し始め、思考連鎖の監視には劣化の兆候が見られました。
研究者たちはこれまで、自分たちのモデルが過小評価されているのではないかと懸念していました。
次に難しいのは、次世代モデルが製造される前に、研究室が過小評価していたことを時間内に発見できるかどうかです。
コメント