要約:
この 2 日間で、GPT-6 Astra のさまざまな驚くべきゲームプレイに誰もが衝撃を受けたと思います。一言で完成した 3D モデリング、ゼロから完全なゲームを作成、一目で何千もの部品を解体、さらにはそれをロボットの制御にも使用できます... 一言で言えば、信じられないほど強力です。ネチズンは「ゆっくり学べば学ぶ必要はない」という大袈裟な格言を持っています。しかし、GPT-6 Astra は、発売されるやいなや、もともと多くの分野を悩ませていた複雑さが突然解決されたように見えるという感覚を人々に与えます。
この傾向を過小評価すべきではありませんが、モデルの現在の機能を誇張しすぎないでください。この記事では、GPT-6 Astra のさまざまな素晴らしいゲームプレイとその現在の制限について説明します。
3D モデリング、
突然楽になったでしょうか?
過去 2 日間でアストラの最も集中的な画面スワイプ機能はおそらく 3D です。
誰かがこれを使用して 3D 列車を直接生成しました:

![]()
両方のトレインは、ブラウザで実行するときに TypeScript と Three.js コードを使用して Astra によって直接生成されます。ボディのサイズ、輪郭、およびさまざまな幾何学的構造は、コード内のサイズ パラメーター、プロファイル、およびジオメトリ関数から取得されます。車輪の動きはコードであり、列車全体が爆発したり、部品がバラバラになったり、再び組み立てられたりするアニメーションもすべてコードです。
さらに、これらのモデルは作成後にパーツに分解することができます。カメラは 122 のコンポーネント グループと 1877 の個別にモデル化された部品に分解できます。タスク全体の実行には約 3 時間かかりました。著者は、Three.js (ブラウザーで 3D グラフィックを作成および表示するために使用される JavaScript ライブラリ) がこのように使用できるとは知らなかったと述べました。
![]()
カメラは分解できますが、テスラも分解できます。誰かが334個のモデリングパーツに分解したもので、その334個のパーツの名前や番号、基本構造は公式のものでAIで捏造されたものではありません。もちろん、これは非常に大まかなフレームレベルの分解にすぎず、3D 分解に必要な詳細レベルには程遠いです。
![]()

興味深いことに、この著者はテスラを解体した後も満足できず、「人 (男性) を解体する」ための Web サイトまで構築しました。全身の 2234 個のモデリング パーツを 1 つずつ表示し、ソース ファイルにマッピングできます。
![]()
これらの事例を見て、「3D モデリングの学生にとっては絶望的な状況だ」と叫ぶ人もいます。

しかし、現在の AI の直接的な成果はまだ商用化されていないと言う人もいます。

さらに、安定性も大きな問題です。結局のところ、バグを修正するには依然として人が必要です。

これらのデモの重要性は、Astra がモデル化できることを証明することだけではありません。さらに重要なのは、新しいインタラクション方法を実証することです。人々は複雑な 3D ソフトウェアを学ぶ必要がなくなり、望む世界を直接記述し、アイデアを空間構造に変換する役割を AI に任せることができます。
かつては、3D モデリングがデジタル世界に参入するための入り口でした。将来的には、AI が現実世界を理解して生成するための基本的な能力になる可能性があります。もちろん、真の産業グレードのアプリケーションまでにはまだ長い道のりがありますが、その道筋はますます明確になってきています。
ソフトウェアを学ぶ必要はありませんか?
アストラ、自分で入ってください
OpenAI の公式の位置づけでは、コンピュータの使用とブラウザの使用は GPT-6 Astra の切り札の機能です。 Canva ペイントの例では、これが実際に動作しているのを確認できます。
この場合、ネチズンはアストラに、Canva で自分を描くように依頼しました (参考写真から肖像画を複製する)。描画プロセス中、Astra はブラウザで Canva インターフェイスを直接制御できます。ツールを選択し、正確にクリック/ドラッグし、レイヤーごとに (背景から体、腕、顔の細部まで) 描画し、最終的に非常に類似したピクセル スタイルの半現実的なポートレートを完成させます。
![]()
これには、長時間にわたる複数ステップの操作 (作成者のフィードバックは約 1 時間)、ツールの切り替え (途中で問題が発生すると Chrome がコンピュータ使用モードに切り替わる)、さらに非常に高いインターフェイスの理解と細かい制御の精度も伴います。


隣の Fable 5.1 にも同じプロンプトが表示されましたが、その結果はネチズンを失望させました:

この実験を行っているのは彼だけではありません。別のネチズンも同じ写真を撮り、2 つの AI にそれを描くように依頼しました。結果は同様でした。Astra はより現実的で、Fable 5.1 はより自由で簡単です...


ビデオリンク: https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
しかし、一部のネチズンは、これらの最終的な視覚効果が焦点ではないと指摘しました。重要なのは、Astra がサポートするエージェントはすでに Blender、Unreal Engine、ブラウザを自分で操作でき、プロンプトを直接プロジェクト ファイルに変換できることです。


ここ数日で、「アストラは Blender を使用してサンフランシスコ芸術宮殿を再建する」、「古い蒸気機関車の図面が Blender で 3295 個の編集可能なオブジェクトに変わった」、「600 人のアストラ エージェントが同じアンリアル ワールドに住んでいる」はすべて、この方向の典型的なケースです。


ビデオリンク: https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
もう 1 つの興味深いケースは、「ピアノを弾く」です。 OpenAI の従業員である Victor E. Nunez 氏は、Astra にオンライン ピアノを見つけて、Computer Use を使用して「River Flows in You」を演奏するよう依頼しました。実行プロセス中、Astra はオンラインの仮想ピアノ Web サイトを自ら検索して開き、コンピューター使用を使用してコンピューター インターフェイスを直接制御しました。マウスを「右手」としてクリックし、ピアノの鍵盤をクリックしました。キーボードコントロールは「左手+クイックパラグラフ」として扱われます。二人は同時に演奏し、リズムと音符の長さを正確にコントロールし、「River Flows in You」という曲を完璧に演奏した。

ビデオリンク: https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
さらに興味深いのは、Astra が画面自体を録画し、このデモ ビデオを編集したことです。プロセス全体はエンドツーエンドで、タスクの理解→ウェブサイトの検索→楽器のロード→リアルタイムでの演奏となり、中間ステップでの手動介入は必要ありません。
これらの事例は、GPT-6 Astra がエージェント コンピューターの使用において新たな高みに到達し、速度、精度、マルチツールの並列性、リアルタイム フィードバック機能がすべて非常に高いレベルに達していることを示しています。
おそらく将来、人々は特定の専門的なソフトウェアの機能を AI 機能に再作成する方法について考えるのをやめ、ソフトウェアを AI に引き渡すだけになるかもしれません。人間向けに設計されたあらゆるソフトウェアを操作できるようになることで、AI の適用シナリオが大幅に広がります。
画面の外、
アストラがロボットの制御を開始します
以前のデモがどれほどとんでもないものであったとしても、それらは基本的にすべてコンピューター上で行われました。
ネチズンのジェイ・チョイ氏が行ったテストは異なっていました。実際にアストラをロボット アームに接続しました。
![]()
タスクの 1 つは、ロボット アームにブロックをボウルに入れることです。 GPT-6 Astra は 20 回実行され、成功率は 95% に達しました。対照表 5.1 は 40% でした。同時に、出力トークン数は後者の約 16% にすぎず、コストは後者の約 43% にすぎません。
さらに重要なのは、このタスクに関する Astra のデモンストレーションや微調整が行われていないことです。ジェイ・チョイは後に、これはゼロショットテストだったと具体的に付け加えた。モデルは、ロボット アームのエンド エフェクターの位置と姿勢を与え、それを自動逆運動学ソルバーを通じてロボット アームの動きに変換する役割を果たします。
大型モデル トークンの出力速度が加速するにつれて、LLM は早ければ今年末、遅くとも 2029 年にはリアルタイムでロボット アームを制御できるようになるだろうとジェイ チョーイ氏は楽観的に予測しています。

NVIDIA の元研究員である Yu Xiang 氏は、ロボット工学の次のフロンティアは、制御に高度な AI モデルを真に使用する方法である可能性があるとさらに指摘しました。認識および計画モジュールを呼び出すエージェントとしてそれらを使用するだけでは十分ではありません。これらのモデルを物理世界に接続する新しい方法が必要です。
![]()
このような結果も人々に興味を抱かせます。モデルをこれほど多用途にするために、OpenAI はトレーニング後に何を追加しましたか?それとも事前トレーニングに画期的な進歩があるのでしょうか?
![]()
まだ勉強中ですか?
これを読んだ後、AI はもはや画像を生成することに満足せず、「世界を再構築」しようと試み始めたと嘆く人もいます。
![]()
当然のことながら、次のような疑問が生じます。AI がモデル化、コードの作成、ソフトウェアの操作が可能になり、さらには物理世界に触れ始めるとき、私たちが今日熱心に学習したスキルのうち、どれだけが現在の形で残っているでしょうか?
![]()
この質問に対する答えは今のところありません。 Astra には不安定だったり、粗かったり、まったく使い物にならない点がまだたくさんありますが、この 2 日間で本当に不安で刺激的なのは、まさにこれかもしれません。デフォルトでは人間が習得しなければならない複雑な操作の多くが、初めて AI 用に全体としてパッケージ化されることが可能になったのです。
「将来的にも学ばなければならないか?」については、答えは間違いなく「まだ学ばなければならない」です。ただ、何を学ぶ価値があるのかを再考する必要があるかもしれません。
コメント