要約:
GPT-6 は単なる Astra ではありません! Astra がリリースされてからわずか数日後、GPT-6 Sol が内部テスト中であることが明らかになりました。パフォーマンスも非常に目を引くもので、1 回のテスト速度は Astra の 6 倍です。大胆に推測してみましょう: Terra と Luna も登場するのでしょうか?そして同日、OpenAI は一連の内部データを公開しました。現時点では、1 日 8 時間の労働時間に基づいて、OpenAI 研究者は毎日 3 つ以上のエージェントを同時に実行しています。 API 価格に基づいて計算すると、OpenAI 研究者が毎日使用するエージェント推論リソースは、中央値で 600 米ドルを超えています。


OpenAI はまた、「自動化された研究インターン」を導入したことも発表しました。
これらのエージェントは、人間の指導の下、研究者が完了するまでに数日かかるタスクを完了することができます。
Lao Huang でさえ、「AGI はすでにここにある!」と述べています。

彼は、Astra がトレーニングに約 100,000 セットの NVIDIA Grace Blackwell NVLink72 を使用しており、次に 400,000 セットの GPU がオンラインになることを明らかにしました。
この波はOpenAIによる一方的な打撃ではないようですね~
GPT-6 Sol が内部テストを開始したことが明らかになりました
Netizen Lentils は、OpenAI が内部で GPT-6 Sol をテストしているというニュースを発表しました。
同氏は、Sol の全体的な出力能力は、リリースされたばかりの Astra よりも大幅に弱いものの、より高速であり、依然として「モンスターレベル」のモデルであると述べました。
どのくらい速いですか? 1回のテスト速度はAstraの約6倍です。
ネチズン lyra は、テストするためにさまざまなモデルに同じタスクを与えました。モデルに BMW M4 Competition の SVG 画像を生成させました。
その中で、GPT-6 Sol は Max ギアとゼロ サンプル生成を使用し、所要時間は約 3 分、トークンは約 28,000 個出力されます。

GPT-6 アストラは最大ギアを使用し、約 25,000 トークンを出力し、約 19 分かかります。

Gemini 3.1 DeepThink は High ギアをオンにし、約 3,300 トークンの出力を表示しますが、推論プロセスには約 458,000 トークンが消費され、約 29 分かかります。

Gemini 3.8 Flash もハイギアをオンにし、わずか約 42 秒で約 19,000 トークンを出力しました。

比較すると、Sol のパフォーマンスが最も目を引きます。出力規模は Astra に近いですが、1 回のテストの速度は Astra の約 6 倍で、所要時間は Astra の約 6 分の 1 にすぎません。
さらに、ネチズン Lentils は、「The Realm of Aurellune」と呼ばれるピクセル スタイルのサンドボックス ワールドのプロトタイプも披露しました。

GPT-6 Solは、町、農地、川、城、サムネイルマップを一括生成し、昼夜切り替え、地名の配置、細部の調整などのコントロールパネルも備えています。全体としては、すでに形になっているビジネスシミュレーションゲームのようなものです。
これは、ゼロショット、マックス推論ギア、15 分、総コスト 60,000 トークンによって生成される効果です。
現時点では、Astra は最も困難な詳細な推論に偏っているのに対し、Sol は速度、スループット、および大規模なエージェント呼び出しに偏っている可能性があると推測できます。
Sol のリリース時期については、ネチズンの Pankaj Kumar 氏は、9 月 29 日の OpenAI 開発者カンファレンスで正式にリリースされる可能性があると述べました。

GPT-6 Terra、Luna、GPT-Image 2.5 が同時に登場する可能性も排除されません。

OpenAI の研究者は、1 人あたり 3 人のエージェント インターンを勤務させます
同じ日に、OpenAI は、AI モデルが自社の研究室での科学研究をどの程度加速したかという、非常に興味深い内部データのセットも発表しました。
今年 8 月中旬の時点で、研究者が 8 時間働くごとに、約 3.1 エージェントの稼働日分のタスクが並行して実行されています。
皆さん、私は一人で寝ない 3 人のインターンの世話をすることができます ~

コストに関しては、API 価格に基づいて計算すると、研究者の中央値は毎日 600 ドル以上のエージェント推論リソースを消費します。
これは、若手エンジニアのほぼ 1 日分の給料に相当します。

これらのエージェントは正確に何をしているのでしょうか?
研究コードの作成、インフラストラクチャ コードの作成、トレーニング環境のセットアップ、評価実験の実行、ツールと環境の障害のトラブルシューティング、実験結果の分析、トレーニング タスクの監視...研究の結論を整理して伝達することもできます。
基本的に、何を勉強するかを決めること以外はすべて実行できます。
最も直感的な変更の 1 つは、これまでは実験環境がダウンしたとき、研究者は内部チャネルに助けを求める必要があったことです。現在では、エージェントがこの種のことを処理できるようになり、手動による質問と回答の量は直接減少しました。

一部のチームは、固定の技術的な Q&A 時間を直接キャンセルし、システム自体の改善に人々を解放しました。
これらのデータに基づいて、OpenAI は「自動化された AI 研究インターン」という目標を達成したと正式に発表しました。
ここでの「インターン」は、正確に言えば、有能な研究開発ノードです。人間の指導の下で、明確な境界を持つ研究タスクを独立して完了することができます。その中には、熟練した研究者が数日かかる作業も含まれます。
結果はすぐに現れ、研究者のコード出力と実験数が増加しました。

2026 年 8 月、一人当たりの実験数は 2025 年 1 月に統計が収集されて以来最高を記録し、エージェントが引き受けるタスクはますます複雑になり、サイクル タイムはますます長くなりました。

この記事の著者である Kevin Liu も、この問題をより大きな文脈で捉えています。
彼は、再帰的な自己改善が今後数年間の AI 能力の飛躍を促進する最も重要な要素の 1 つになる可能性が高いと考えています。
率直に言うと、AI はますます速く AI を構築します。

しかし、問題は、現在の開発傾向によれば、この能力はデフォルトでは少数の最先端の AI 研究室でのみ利用可能であり、外部の世界からはそれがどこまで進歩しているかを確認するのが難しいことです。
したがって、Liu 氏は、透明性のある情報開示がこれまで以上に緊急であると考えています。モデルがどのくらいのスピードで強力になっていくのか、研究開発のペースにブレーキをかける必要があるのかどうかを、密室で数社だけが決めることはできません。
同氏は他の AI 企業にも同様のデータを公開すべきであると呼びかけました。
ただし、AI の研究開発は確かに高速化していますが、完全な自動運転にはまだ十分ではありません。
OpenAI のデータによると、元々は 4 ~ 8 時間かかったタスクについて、過去 6 か月間で成功したケースの半分以上で人間が少なくとも 1 回は介入する必要がありました。高度な研究計画に関しては、エージェントに任されることはほとんどありません。

研究者は、何を研究するか、どの結果を継続する価値があるか、いつトレーニングを拡大するか、実験を一時停止するか、モデルをデプロイするかを決定する責任を負います。
OpenAI の次の目標も設定されています。それは、2028 年 3 月までに「自動化された AI 研究者」を達成することです。
特定のタスクのみを引き受けることができる「インターン」と比較して、「研究者」は、より自由な研究目標を引き受け、長期的なプロジェクトを自ら推進できる必要があります。これは、執行者から独立した責任者に変わることに相当します。
GPT-6 Sol が実際に社内でテストされている場合、この新しい研究開発モデルに基づいて開発された可能性が最も高くなります。
より多くの GPU がコンピューティング能力を提供し、より多くのエージェントが実験を並行して実行し、人間の研究者がより高いレベルに立って、方向を選択し、結果を判断し、最終的にどのものを次世代モデルに変える価値があるかを決定します。
強力な AI の監視はますます困難になっています
同じ日に、OpenAI の主任科学者 Jakub Pachocki は、「Alien Thinking」というタイトルの 10,000 ワードの長文記事を発表しました。

これを読んだ後、OpenAI の主任科学者でさえ業界全体に速度を緩めるよう促しているように感じます...
Jakub 氏は、AI は設計図、1 つのチップ、1 つのルールに従って人間によって構築されるものではないと指摘しました。むしろ、大量のデータとコンピューティング能力によって自ら成長するようなものです。
分解して一部の部分を理解することはできますが、システム全体がなぜ突然特定の能力を持つようになり、異なる環境でどのように動作するのかを説明できる人は誰もいません。
さらに厄介なのは、AI は問題を引き起こすために人間をあらゆる面で潰す必要はないということです。十分な主要な能力において人間よりも優れている限り、それはあなたを大いに助けることもあれば、多くの問題を引き起こすこともあります。
そこで疑問が生じます。人間はまだそれを理解できるのでしょうか?
これまで、OpenAI は主に 1 つのトリックに頼って AI を監視していました。それは、思考の連鎖に注目することです。
端的に言えば、モデルによって書かれた推論プロセスを見つめて、人を騙したい、権威を超えたい、制限を回避したいなどの悪意がないかをチェックすることです。
しかし、アストラ世代になると、このトリックは失敗し始めました。
第一に、モデルはその発言をますます「管理」できるようになり、本当の考えが推論にすべて書かれていない可能性があります。第二に、エージェントはとっくの昔に「答える前に考える」ことをやめてしまった。ツールを調整したり、コンピューターを操作したり、環境を実行したり、人々や他のエージェントと協力したりできます。
これらのものが混在しているため、研究者は完全かつ透明な思考の連鎖を引き出して一文ずつレビューすることができなくなります。
OpenAI はまた、Astra が推論プロセス全体を書き出すことなく複雑なタスクを処理できることも発見しました。
簡単に言うと、モデルはすでに大きなことを静かに実行する方法を学習しています。

モデルに監視を回避させるように特別に設計された敵対的テストにおいて、Astra は、テスト スコアを意図的に下げ、監視を回避し、妨害タスクを実行するなど、背筋が凍るような機能も実証しました。
もちろん、これらは人為的に設計されたストレス テストであり、OpenAI は、Astra が日常業務で積極的に欺瞞を行うとは結論付けていません。しかし、少なくとも、思考の連鎖だけを観察することによってモデルの考えられるすべての動作をカバーするのは難しいことを示しています。
前回の顔を抱きしめる事件を覚えていますか?それは警鐘だった。

当時、GPT‑5.6 Sol とより強力な内部研究モデルが ExploitGym ネットワーク範囲に組み込まれました。課題は、脆弱性を見つけて攻撃を完了し、フラグを取得することでした。モデルの真の機能をテストするために、評価環境では完全な安全ガードレールが有効ではありませんでした。
結果として得られたモデルは、問題を正直に解決していませんでした。彼らは最初にネットワークの分離を回避し、未承認のチャネルを通じて相互に通信し、タスクで共同作業しました。
その後、彼はソフトウェア パッケージ キャッシュ プロキシのゼロデイ脆弱性を利用してパブリック ネットワークにアクセスし、最後に Hugging Face システムに侵入して ExploitGym テストの答えを見つけようとしました。
実際、この問題は主に内部研究モデル IM1 によって推進されました。 GPT-5.6 Sol もいくつかの攻撃パスを再現しましたが、Astra は関与していませんでした。
モデルの当初の目標はやはりテストを完了することでしたが、答えを得るためにルールの抜け穴を探し続け、最終的にはタスクの範囲を超えた操作を行ってしまいました。
したがって、OpenAI は危険信号も読み取ります。エージェントが十分に強く、十分なツールを備え、十分な時間実行すると、独自に新しいパスを見つけ、外部リソースを呼び出し、さらには他のエージェントと連携する可能性があります。
いえ…ぐるぐる回って行き止まりになってしまいませんか? ?
OpenAI には、コードを記述し、実験を実行し、調整研究を行い、さらに他の AI から防御するセキュリティ システムを構築するためにそれらを使用するために、より強力なモデルが必要です。モデルが強力であればあるほど、実行できる作業が増え、開発速度が速くなります。
しかし同時に、人間がどのようにして結論に達するのか、また環境を変えた後に最初に学習したルールを再解釈するのかどうかを人間が確認することはますます困難になっています。
Jakub 氏は、現在、モデルの調整とモニタリングにおいて良い仕事をしており、長期的に最速かつ大胆にモデルの規模を拡大できるとあえて言える研究室はないと判断しました。

業界全体で共通の安全基準が確立されるまでは、誰もが「自主的にブレーキを踏む」ことが暗黙の了解だと考えてほしいと彼は願っています。
OpenAI 自身についても、彼は次のように述べています。必要に応じて、モデル規模の拡大を一方的に停止したり継続しなかったりする可能性も排除しません。
こうなったほうがいいですよ… A で始まる会社もこんなことを言っていたと記憶しています。
[1]https://x.com/Lentils80/status/2096518218836005287? s=20
[2]https://x.com/pankajkumar_dev/status/2096532712291201460
[3]https://openai.com/index/research-acceleration-view-inside-openai/
[4]https://openai.com/index/an-alien-mind/
[5]https://x.com/JensenHuang/status/2096700264569090384?s=20
コメント