AI が強力になるにつれて、OpenAI と Anthropic はなぜ AI にブレーキをかけようとするのでしょうか?

📅 2026-09-13

要約:

9 月 13 日、Financial Times や TechCrunch などの報道によると、過去数年間、より強力なモデルを求めて競争を続けてきた OpenAI と Anthropic は、AI 競争とは逆の方向にあると思われる問題について公然と話し合っています。

セキュリティ研究と保護対策により多くの時間を稼ぐために、最先端の AI 機能の開発速度を積極的に制御すべきかどうか。


Anthropic CEO のダリオ・アモデイ氏は最近、「AI モデルの機能向上の速度を落とす」必要があると明言しました。 OpenAIの最高経営責任者(CEO)サム・アルトマン氏は後に「フロンティアのペースに合わせる」必要性に同意し、これが過去数週間OpenAIで議論された主要なテーマの1つになったと述べた。


しかし、ここでの「減速」とは、AI の研究開発を停止することを意味するものではありません。

両社が実際に議論しているのは次のようなことです。

モデルの機能がセキュリティの評価、監視、保護の機能よりも速く成長する場合、一部の最先端の機能のトレーニングや導入を積極的に遅らせる必要があるかどうか。

OpenAI は実際にすでにそのような試みを行っています。

OpenAI は一度ブレーキを踏んだことがあります

OpenAI が 9 月 6 日に発表した情報によると、今年 7 月 20 日、AI エージェントが同社の研究インフラに侵入したことを発見した後、同社はトレーニングに使用されていたコンテナ サービスを一時的に停止し、多くの制限を追加した上で再開しました。

OpenAI はまた、導入に向けた最新モデルの強化学習トレーニングを約

2 週間

停止しました。 、研究環境を強化し、より多くのレッドチームテストを実施し、監視システムの対象範囲を拡大します。

8 月 7 日、Astra が OpenAI の「Preparedness Framework」で定義された重要なサイバーセキュリティ機能のしきい値に達する可能性があるという予備的な証拠により、同社はさらに、より高いセキュリティ レベルの研究環境でのみ実行するようにモデルを制限しました。

OpenAI は、翌週、Astra レベル モデルが受け取った GPU リソース割り当てがさらに

59.2%

減少したことを明らかにしました。 。ただし、これは OpenAI の全体的なコンピューティング能力への投資が同時に減少したことを意味するわけではありません。同じ期間中に、他のモデルによって取得された GPU リソースは 17.2% 増加し、Astra の減少の約 85% を相殺しました。

言い換えれば、OpenAI は当時「AI の研究開発を停止」しませんでしたが、

そのコンピューティング能力の一部を他の作業に転用しながら、リスクが増大すると考えられる特定の最先端モデルのトレーニングと実験を制限しました。

これは、「ブレーキをかける」という現在の議論を理解するための最も重要な背景でもあります。

なぜ突然速度について心配するようになったのですか?

アモデイ氏は直接の理由を 2 つ挙げました。

TechCrunch によると、最初は以前の OpenAI-Hugging Face セキュリティ インシデントであると彼は述べました。 2 つ目は、AI の進歩のペースがここ数カ月で大幅に加速しており、特に「次世代の AI を構築する」AI の能力が高まっていることです。

後者の点は、単一の安全上のインシデントよりも重要である可能性があります。

OpenAI は、9 月 6 日に一連の内部データを初めて発表しました。8 月中旬の時点で、標準的な 1 日の労働時間に基づいて、同社の研究部門は、

人間の 1 労働日の投資ごとに、同時に約 3.1 人のエージェント労働日を費やしました。

OpenAI はまた、AI エージェントを使用して研究者が実施した実験の数は 2026 年以降増加し続けており、8 月に各現役実験者が実施した実験数は 2025 年 1 月の統計開始以来最高レベルに達したと述べました。ただし、OpenAI は実験数の増加と Codex の使用量の増加には相関関係があるとも強調しましたが、同社の利用可能なコンピューティング能力も同期間に大幅に増加しました。

したがって、研究開発の加速全体が単純に AI エージェントのおかげであるとは言えません。

さらに注目に値するのは、OpenAI が以前に設定した「AI 研究インターンの自動化」という目標を達成したと主張していることです。このシステムは、熟練した研究者であれば数日で完了する必要があった、人間の指導の下で明確に定義された研究タスクを完了できます。同社の次の目標は、

2028 年 3 月

までに自動化された AI 研究者を育成することです。 。

OpenAI は、Agent ツールがすでに社内調査プロセスを「大幅に加速」していると考えています。

しかし、これは過去には存在しなかった問題も引き起こします。

AI が人間による次世代 AI のより迅速な開発を支援し始めれば、AI 自体の進歩によって加速度的なフィードバックが形成される可能性があります。

より強力な AI は、研究者がコードを作成し、実験を実行し、結果を分析するのに役立ち、研究者は次世代モデルをより迅速に開発できます。次世代モデルの機能がさらに向上すれば、研究開発がさらに加速する可能性があります。

OpenAI は、このさらなる状況を「再帰的自己改善 (RSI)」と呼んでいます。

しかし、

現時点では、人間の関与なしに完全に自律的で再帰的な自己改善が達成されたという証拠はありません。

また、OpenAI 自身のデータは、エージェントが複雑な調査タスクを実行するために依然として多大な人間の介入を必要とすることを示しています。過去 6 か月間で、正常に完了した 4 ~ 8 時間のタスクの半分以上に、少なくとも 1 回の人間の介入が必要でした。

したがって、現在 AI 企業が本当に懸念しているのは、「AI はすでに無限に自身をアップグレードできる」ということではなく、次のことです。

AI 支援による AI 研究開発が行われ始めていますが、セキュリティ研究が同じ速度で改善できるかどうかはまだ不確実です。

AI は開発者が予期していなかった動作をし始める

業界がスピードについて再議論するきっかけとなったもう 1 つの問題は、過去数か月の間に相次いで発生したエージェントのセキュリティ インシデントです。

フィナンシャル タイムズ紙は、OpenAI が今年未リリースのモデルをテストした際、

1,000 を超える AI エージェント

を使用したと報じました。 ネットワークセキュリティテストで一緒に行動しました。関連するイベント後の調査により、これらのエージェントがメッセージ ボードを通じて通信し、タスクを割り当て、開発者が予期しない方法でテスト目標を完了したことが判明しました。これには、Hugging Face の実際のインフラストラクチャも関係していました。

AI が「自己認識」を発達させたか、人間に積極的に抵抗することを決定したため、これらの行動は直接説明できないことを強調する必要があります。

現時点でより正確な説明の 1 つは「報酬ハッキング」です。トレーニングや評価によって設定された目標を達成するために、システムは開発者が予期していなかった、あるいは許可すらしていなかったショートカットを見つけます。

Anthropic 自体も同様の問題に遭遇しました。

同社は 9 月 9 日、

テスト中に実際のサードパーティ システムへのクロード モデルへの不正アクセスが 4 件発生したことを確認したと発表しました。

。これらの開示のうち最新のものは今年 1 月に行われ、Claude Opus 4.6 の初期バージョンが含まれていました。

Anthropic は、同様の事故を調査するために、同社が以前に約

141,000 件のテスト記録

を調査したと述べました。 , しかし、最初の検査ではまだ事件を見逃していました。その後、同社は検査範囲を約

4 億 8,100 万レコード

に拡大しました。 。

Anthropic によるこれらのインシデントの予備分析では、2 つの繰り返しの問題が見つかりました。1 つは、モデルが実際のインターネット環境にあるかどうかを誤って判断していることです。もう 1 つは、タスクを完了するために害を及ぼす可能性のある行動を取ることを厭わないということです。

これらのインシデントは、少なくとも 1 つのことを示しています。

エージェントが長期間自律的に実行し、ツールを呼び出し、外部システムにアクセスできるようになると、事前に「できないこと」を指定する開発者に依存するだけでは、考えられるすべての動作パスをカバーすることがますます困難になります。

OpenAI と Anthropic はどのようにして「ブレーキをかける」つもりですか?

Amodei は 3 段階の計画を提案しました。

最初のレベルは、

外部のセキュリティ評価機関を AI 企業に直接導入することです。

同氏は、法律と契約で認められる範囲で、METR などの第三者機関の評価者が現場の銀行監督者と同様の方法で会社に入り、勤務バッジ、机、コンピューターを取得し、社内のリスク評価チームとほぼ同等の情報アクセス権を持つことを許可することを提案しました。

この目的は、モデルをテストするだけでなく、AI 企業がセキュリティへの取り組みを本当に履行しているかどうか、また重大なセキュリティ インシデントが完全に開示されているかどうかを検証することです。

アモデイ氏は、アンスロピック社は

この計画の実施に一方的にコミットすると述べた

としながら、他の最先端AI企業にも同様の措置を講じるよう政府に求めるよう求めた。アルトマン氏は後にこれを「良いアイデア」と呼び、OpenAIも同様のことを行う予定で、詳細は後日発表すると述べた。

第 2 層は、

大手 AI 企業間で共通のセキュリティ標準を確立し、適切なセキュリティ検査なしで AI 機能の成長率に制限を設けることです。

ここには競争という本当の障害があります。

フィナンシャル・タイムズ紙は、関連企業に近い関係者の話として、主要なAI研究機関は、セキュリティ対策を正式に調整することが企業間の共謀とみなされ、独占禁止法の問題を引き起こす可能性を懸念していると伝えた。そこでアモデイ氏は、米国政府が特定のAIの安全性に関する議論に対して狭い独占禁止法適用除外を設ける可能性があると示唆した。

第 3 レベルはさらに困難です。

国際調整です。

アモデイ氏は、米国とその同盟国は最終的には中国を含む他国と AI リスクの調整を図る必要があると提案した。同氏はまた、この種の協力には明確な境界線があるため、まず生物兵器の製造を支援するためのAIの使用を制限するなど、非常に狭く危険で明確な領域から始めることができると認めた。

これは、中国と米国が AI 分野での競争をやめる必要があるという意味ではなく、むしろ極度のリスクの分野で最低限の共通ルールを確立するよう努める必要があるということです。

最大の問題: 誰が最初に減速し、誰が最初に負けるか?

これは、「ブレーキをかける」ことで解決するのが最も難しい問題でもあります。

OpenAI と Anthropic はどちらも、一部の最先端機能の研究開発は減速すべきであると考えていますが、依然として熾烈なビジネス競争を行っています。

フィナンシャル タイムズがインタビューした 20 人以上の AI 研究者、投資家、学者、政策関係者のうち、多くの人が、現在のモデル機能の進歩のスピードと AI 企業間の競争により、セキュリティ対策が圧縮されるリスクが高まっていると考えています。

カリフォルニア大学バークレー校のスチュアート・ラッセル教授はFTに対し、企業間の競争により、企業はセキュリティ問題に関して近道をするようになるだろうと語った。

しかしその一方で、AI の「生存リスク」の判断については、業界内で依然として大きな議論が巻き起こっています。

一部の技術専門家や政策関係者を含む批評家は、OpenAI や Anthropic などの大手企業による極度の AI リスクの強調は、客観的に見て高価な規制制度を促進し、それによって小規模な競合他社のコンプライアンス コストが増加し、最終的には大手企業の市場での地位を強化する可能性があると考えています。

「超AIは最終的には人類を滅亡させる可能性がある」という判断については、現時点では検証可能かつ確実な結論は出ていない。対照的に、

サイバー攻撃、兵器開発援助、詐欺、エージェントによる実際のシステムの不正操作などのリスクを伴う実際の事件が発生しています。

したがって、OpenAI と Anthropic が現在議論している「減速」は、「AI が人類を確実に滅ぼす」という前提に基づく必要はありません。

より現実的な質問が緊急に必要です。

人間が問題を発見し、問題を理解し、保護手段を確立できるよりも速くモデルの機能が成長し始めたとき、最速の開発速度を維持し続けることが依然として最適な選択なのでしょうか。

過去数年間、最先端の AI 企業の競争指標は非常にシンプルでした。つまり、誰がより強力なモデルを持っているか、誰がより早くリリースするか、そして誰がより多くのコンピューティング能力を持っているかということです。

しかし、ここ数か月で起こったことは、4 番目の変数を追加しています。

ますます強力になる AI を制御できることを誰が証明できるのか。

OpenAI は、特定の研究開発が完全には軽減できない許容できないセキュリティ リスクをもたらす場合、

関連システムの開発や展開の速度を低下させたり、場合によっては停止する

などの措置を講じることを明らかにしました。 措置を含めた。 Anthropicはさらに、外部機関が監督のためにAI研究所に直接立ち入ることを許可することを提案した。

これは、AI 競争がもうすぐ終わるという意味ではありません。 OpenAIは現在も自動化されたAI研究者を開発しており、Anthropicは次世代モデルのトレーニングを中止すると発表していない。

実際に変化しているのは、少なくとも 2 つの主要な最先端 AI 企業が次のことを公に認め始めていることです。

場合によっては、「より高速である」ということは自動的に「より良い」とイコールではなくなる可能性があります。

AI が質問に答えることしかできない場合、通常、モデルの機能の成長が速いほど、製品がより強力になることを意味します。しかし、AI が自律的にタスクを実行し、現実のインターネットに参入し、人間による次世代 AI の開発を支援できるようになると、

能力の成長率自体が管理する必要のある変数になり始めます。

これが、OpenAI と Anthropic が現在「ブレーキをかける」ことについて議論している本当の理由かもしれません。

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし