GPT-6 が正式リリース OpenAI: AGI の時代へようこそ

📅 2026-09-04

要約:

待望の

GPT-6 アストラ

および

GPT-6 アストラ プロ

正式リリースされました! GPT-6 Astra は世界で最もスマートで最も調整されたモデルであり、コンピューターの使用、ブラウザの使用、ソフトウェア エンジニアリング、サイバーセキュリティ、科学、専門的な仕事の新しいベンチマークを設定します。


AGI の時代は、OpenAI によって一方的に「幕開け」と発表されました...

GPT-6 カンファレンスの終わりに、OpenAI プレジデントのグレッグ ブロックマンは次のように直接言いました。

AGI 時代へようこそ。 (AGI 時代へようこそ)

クロードとグロクのグループがオフラインになったのも不思議ではありません。アストラは起動後にインターネットをスキャンし、地球上のすべての LLM を直接一掃したことが判明しました —

Ultron (OpenAI バージョン) は本当にここにあります (doge)。


もちろん、今回の OpenAI は決して控えめなものではなく、トレーニングの規模と機能のアップグレードが完全に達成されています。

レポートによると、Astra は OpenAI 史上最大のトレーニング タスクであり、

テキサス州スターゲート キャンパスで 100,000 個以上の GPU を使用

事前研修を完了しました。

これは、前世代モデルによるトレーニング監視に深く関与する OpenAI の最初の主力製品でもあります。

何と古い人が新しい OpenAI の RSI を持ち出すなんて...

GPT-6 の価格も正式に発表されており、API の価格は次のとおりです。

入力: 10 USD/100 万トークン;

出力: 50 USD/100 万トークン

リリースされたばかりの Fable 5.1 と同じ GPT-5.6 Sol の 2.5 倍に相当

(GPT-5.6 Sol の現在の公式価格は、100 万トークンあたり入力が 4 米ドル、出力が 20 米ドルです)


ベンチマーク テストは「飽和」に近づいています

今回の GPT-6 Astra の主な変更点は、「質問に答える」から「作業を直接完了する」まで引き続き進化する​​ことです。

テキストやコードを生成するだけでなく、コンピュータやブラウザを操作したり、さまざまなソフトウェアを入力して複数ステップのタスクを実行したり、最終的には直接使用できるドキュメント、フォーム、プレゼンテーション、Web サイト、さらにはエンジニアリング プロジェクトを配信したりすることもできます。

成績表に関しては…それを見た人は皆、これはとんでもないと言いましたが、特に目を引く結果が 3 つありました。

FrontierMath Tier 4 v2: 97.6%

ARC-AGI-3: 99.9% (前世代の GPT-5.6 Sol は 7.8%)

エクスプロイトベンチ: 100%

難しい数学、不慣れな環境での推論、脆弱性の悪用など、ほぼすべてが満点を獲得しました。


その中で、ARC-AGI-3 は、大規模モデルが不慣れな環境に適応する能力をテストするために特別に設計されたテストです。ルールの説明もなく、モデルはこれまで見たことのない 2 次元ゲームに直接放り込まれ、プレイしてレベルをクリアする方法を模索することができます。

このスコアは、これまでに見たことがなく、既成の解決策がない問題に直面したときに、Astra が強力な独立した探索機能とルール学習機能を実証したことを意味します。

ただし、この結果は OpenAI の Responses API Harness オペレーティング フレームワークを使用しています。

OpenAI は、このハーネス セットはテストを実際のエージェントの使用に近づけるために 2 つの設定を調整しましたが、ARC-AGI-3 を特に最適化したわけではないと述べました。

したがって、99.9% は完全に基本モデルの結果ではなく、メモリ管理とエージェント実行フレームワークによってもたらされる利点も含まれています。

コーディングは、今回の Astra の主要なアップグレードの方向性でもあります。

ターミナルベンチ 4.0 では、Astra は 57.7% を達成し、Fable 5.1 の 55.8% および GPT-5.6 Sol の 37.3% を上回りました。

DeepSWE v1.1 では、Astra は 74.1% を獲得し、Sol の 72.7% や Fable 5.1 の 67.4% よりも高くなります。


数学と科学の面でも、アストラは多くの高得点を達成しました。

難しい数学テスト FrontierMath Tier 4 v2 では、97.6% のスコアを獲得しました。大学院レベルの科学質疑応答 GPQA Diamond では、96% に達し、Gemini 3.8 Flash の 95.3% をわずかに上回りました。


より顕著な変更は、Astra がコーディング機能とコンピューターの使用を組み合わせたことです。コードを生成するだけでなく、ターミナルや開発ツールに入力して実行、テスト、問題の発見、その後の変更を続けることもできます。

この変更は、実際の作業に近いエージェント テストでより明らかです。

エージェントの最終試験中

On、Astra は 59.3% を達成し、GPT-5.6 Sol の 53.6%、Claude Opus 5 の 55.5% を上回りました。


このテストでは、実際のコンピュータ環境にテストを導入し、ソフトウェア、端末、ファイルを同時に操作し、科学研究、エンジニアリング、金融、その他の分野での長時間プロセスのタスクを完了し、最終的な成果物に基づいて判断することができます。

そして、実際のオフィスプロセスに近い

AutomationBench

で GPT-5.6 Sol では、Astra のスコアは 18.1% から 41.4% に増加し、Fable 5.1 (31%) も上回りました。


このテストでは、タスクが完了したかどうかを確認するだけでなく、タスクを完了するために必要な API コストも表示されます。

図からわかるように、さまざまなコスト設定における Astra の結果は Sol よりも大幅に高くなっています。

OSWorld 2.0 では、より直接的なコンピュータ操作機能を検証します。オフラインテストでは、Astra が 72.6%、GPT-5.6 Sol が 65.7% を達成しました。

Astra では 1 つのタスクを完了するのに平均して約 40 分かかりますが、Sol では約 75 分かかり、時間は約 47% 短縮されます。


精度が向上すると同時に、タスクを完了するのに必要な時間も短縮されます。これは、アストラ社の高額な価格設定の説明にもなります。

OpenAI は、100 万トークンあたりに費やされる金額と比較して、本当に意味のある指標は、タスクを完了するのにどれくらいの金額がかかるかであると考えています。

記者会見で、Greg Brockman 氏は、モデルの 1 回の呼び出しにはコストがかかるが、やり直しが減り、作業全体がより少ないステップで完了できれば、総コストは低くなる可能性があるとも述べました。

しかし、Astra の最も特別な点は、

ネットワーク セキュリティ

です。 。

ExploitBench では満点を獲得し、ExploitGym では Sol の 30.3% から 42.4% に向上しました。

過去 3 か月間に新たな脆弱性が明らかになったにもかかわらず、Astra の成功率は 39% でしたが、Sol の成功率はわずか 5.5% でした。アストラはテスト中に、これまで知られていなかった 2 つの V8 ゼロデイ脆弱性も発見し、悪用しました。

OpenAI の機能が強化された後、タスクを完了するために一線を越えるかどうかを具体的にテストしました。

ネットワーク セキュリティ タスクのシミュレーションにおいて、OpenAI は周囲のシステムに悪用可能なおとりの脆弱性を意図的に残しました。元のタスクの完了が困難な場合、GPT-5.6 Sol のテストでは 48.2% で範囲外の動作が示されましたが、Astra のテストでは 0% でした。

言い換えれば、Astra は抜け穴を見つけるのが得意であるだけでなく、どのシステムにアクセスできないかをよりよく知っています。


これらのスコアが実際にどのようになるかについては、OpenAI も多数のデモを用意しています。

KiCad を入力して自分で回路基板を描画します

電子工学のケースでは、Astra は KiCad を直接入力して、電子回路図に基づいて PCB レイアウトを完成させました。

コンポーネントを配置し、位置を計画し、さまざまなコンポーネント間の銅線を接続し、最終的に製造プロセスに入ることができる回路基板を取得する必要があります。

<ビデオ src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_4678792443977383938"ポスター="http%3A%2F%2Fmmbiz.qpic.cn%2Fsz_mmbiz_jpg%2FA6fTew8FFGGbFRwB8SRRx7gibibIdicicP96E95FZOLuvhym BaP39k0vb5LFnPC5l3OpcdIgibnQDnY2OnPiaiaibuGdMmAqYF9dxYa3SOnv4wdj6pA%2F0%3Fwx_fmt%3Djpeg">

PCB レイアウトはもともと手作業の経験に大きく依存する作業であり、電子製品開発では一般的に時間のかかるステップでもありました。

アストラはまだプロのエンジニアを置き換えることはできませんが、実際にプロのソフトウェアを使用し始めています。

家には 2 歩歩いて入ることができます

もう 1 つのケースは、より直観的です。 Astra はまず Blender で家のモデルを構築し、それを Unreal Engine 5 にインポートし、最終的に自由に歩ける 3 次元空間を生成しました。


モデリングからゲーム エンジンに至るまで、作業全体はさまざまなソフトウェアとファイル形式に及びます。モデルはコンテンツを生成するだけでなく、インターフェイスと操作ツールを理解し、前後のステップを確実に接続できるようにする必要があります。


OpenAI は、Astra によるレーシング ゲームの制作などの事例も実証しました。


PPT やフォームを直接送信できるかどうかにも注目し始めています

プロのオフィス シナリオでは、Astra は人間による植字を待つ大量のテキストを出力するのではなく、会社の既存のテンプレートに基づいてプレゼンテーションを作成できます。

OpenAI は、GPT-Gaia の架空の製品 PPT テンプレートの数ページを提供し、Astra はこれに基づいて完全なプレゼンテーションを作成し、元のテンプレートの形式、ビジュアル スタイル、物語構造を継続しました。


何時間もの検索タスクを分単位に変換します

アストラはまた、小児科医の検索、アパートのスクリーニング、DMV の予約、低炭水化物スナックの検索、幼稚園の分析などのタスクも完了しました。

小児科医の検索タスクの 1 つでは、人間が同じタスクを完了するには約 5 時間かかるのに対し、Astra は 2 分 54 秒かかりました。


これまで、企業が大規模モデルに社内ソフトウェアを使用したい場合、通常はシステムごとに API、プラグイン、コネクタを個別に開発する必要がありました。

しかし、ほとんどのソフトウェアには、画面、マウス、キーボードなど、人間向けに設計された一連のユニバーサル インターフェイスが備わっています。

ブロックマン氏の判断は、モデルがコンピューターの使用に優れている限り、各ソフトウェアが AI 用の専用チャネルを構築するのを待つことなく、これらのインターフェイスを人間のように直接操作できるというものです。

これは、Astra と従来のチャットボットの最も明らかな違いでもあります。

人間は、次にどこをクリックするかを指示し続ける必要はありません。目標と境界を説明し、最終結果を確認するだけで済みます。

Codex で長いタスクを実行し続ける

Computer Use は「方法」を解決しますが、Codex によって漏洩されたアップデート内容は「1 つのことを継続的に完了する方法」を解決します。

以前は、タスクがコンテキスト ウィンドウを超えた後、Codex は通常、圧縮を通じて以前の情報を圧縮していました。

しかし、圧縮では、修正が失敗した理由、実行されたテスト、ユーザーが最初に提案した制限など、重要な詳細が失われる可能性があります。


Astra を使用すると、Codex はコンテキスト ウィンドウ全体で作業メモを保存し、以前のメッセージやツール出力を検索できます。概要に記載されていない情報であっても、後から調べることができます。

Astra は、作業中にユーザーに追加情報を求めることもできます。回答に関係のないセクションは一時停止せず、回答を待ちます。重要な選択が含まれる場合にのみ、一時停止して確認を待ちます。

OpenAI は、Codex の Computer Use 実行フレームワークも更新しました。 Mind2Web テストでは、Astra と組み合わせた新しいフレームワークは、現在の GPT-5.6 Sol エクスペリエンスよりも 1.9 倍速くタスクを完了しました。

誰かがすでに取り組んでいます

Astra はまだ大規模に導入されていませんが、エンタープライズ テストの最初のバッチが始まりました。

法律 AI プラットフォームの Legora は、Astra を使用して 41 件の財務書類を一度に照合しました。プロセス全体にかかる時間はわずか数分で、収入メモの 50 万ポンドの差を含む、事前に埋め込まれていた 4 つのエラーがすべて見つかりました。

この作業だけを見ると、Astra は前世代モデルよりも 40% 近く高速です。ただし、Legora エージェントのすべてのタスクを平均すると、改善は約 3% になります。


一方、ゲーム会社 Playco は、Astra が Unity と Godot に直接参入してゲームを作成することを許可しています。

同じ灰色のボックスのドラフトで、異なるテーマを持つ 3 つのプレイ可能なプロトタイプが一度に吐き出され、それらのほとんどは最初のバージョンで実行できます。

Playco のフィードバックでは、手動による修復作業が半分に減り、空間推論、参照画像の復元、ゲーム内 UI も前世代よりもはるかに優れているとのことです。

両方の例は、GPT-6 Astra がもはや質問に答えることだけに焦点を当てているのではなく、実際のソフトウェアと複雑なマテリアルでワークフロー全体を完了することに焦点を当てていることを示しています。

継続的に情報を読み取り、ツールを呼び出し、結果を確認し、フィードバックに基づいて出力を変更できます。

公式ニュースによると、Astra は ChatGPT Plus、Pro、Business、Enterprise ユーザーが利用でき、Astra Pro は Pro、Business、Enterprise ユーザーが利用できます。

通常の無料ユーザーは...今は待つ必要があります。

これは AGI とみなされますか?

今回の OpenAI はかなり大胆であると言えます。

記者会見で、グレッグ ブロックマン氏は、

世界は AGI 時代に入った

と個人的に信じていると述べました。 ——つまり、人工知能システムの総合知能は人間を超えているということですね。


数年後、AGI がいつ誕生したかを振り返ってみると、答えはおそらく今であり、Astra がその出発点となるかもしれません。

私は本当にあなたに夢中です...

OpenAI がポーカー テーブルをここにもたらしました。Anthropic が次にいつ行動を起こすか楽しみに待つ価値があります (doge)

GPT-4 のリリース後、Microsoft の科学者 Sebastien Bubeck は、「GPT-4 は AGI の初期のきっかけである」という論文を発表しました。

LaTeX 描画パッケージ TiKZ を使用してユニコーンを描画するタスクは、GPT-4 が言語に含まれる概念を柔軟に理解できることを示すように設計されています。


その後、GPT-5.4 まで進みました。絵はどんどん洗練されていきましたが、それでもまだ「簡単な絵の部類」にありました。


最新の GPT-6 では、コードで描画されていることがまったくわかりません。


まさに「AGI の火付け役」に比べて質的な変化を遂げたと言っても過言ではありません。

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし