OpenAI の最初の「ペッパー」チップが Nvidia の GPT-6 を圧倒し、CUDA をクラッシュさせる

📅 2026-08-26

要約:

OpenAI の最初のチップ生産が実際に NVIDIA シリーズ全体を打ち破ったと信じられますか? !ちょうど今、OpenAI の最初の自社開発チップである Jalapeño が、NVIDIA GB200 および GB300 を完全に上回る AI 推論パフォーマンスという測定結果の最初のバッチを引き渡しました。



測定された速度で直接離陸してください。

Jalapeño は 1 秒間に 1,459 トークンを吐き出すことができますが、Nvidia GB200 は半分にも満たない 535 トークンしか吐き出すことができません。

「Pepper」がタスクを完了するのにかかる時間はわずか 1.65 秒ですが、GB300 では 6 秒近くかかり、完全に 3.6 倍の差があります。

最も残酷なことは、たとえ GB300 が最速のデコード速度に達したとしても、Jalapeño のスループットは依然としてそれよりも 104.3 倍高いということです。

ハラペーニョの公称消費電力はわずか 700 W ですが、GB300 の公称消費電力は 1400 W で、ちょうど半分です。

有名な半導体アナリストのディラン・パテル氏は、「打倒されたのはブラックウェルだけではなく、Nvidia の Rubin チップさえも追い越された」と厳しく言いました。


一時期、AI サークル全体が爆発的に広がりました。ネチズンは、OpenAI が非常にクレイジーだったので Nvidia も敗北したことに驚嘆しました。

ウルトラマンの発言は横暴でありながらも抑制的でした、「私たちはチップを作りました、それはとんでもなく速いのです」!



01

「唐辛子」が Nvidia の主力製品をひっくり返した

これは OpenAI 自体について話しているわけではありません。

セミアナリシスは実際の測定のために研究室に入り、彼らが書いた結論は—

ハラペーニョは、これまでにテストした Nvidia、AMD、Google のすべてのチップを破りました。

その違いはどれくらいですか? Nvidia の最新の Vera Rubin は、ほぼ 3 つのハラペーニョを食べるのに十分な電力を消費します。


テスト中に、OpenAI は、GPT-OSS 120B、670B および 1T モデルの 3 つの公開モデルを実行するように選択しました。

このラウンドのテストは、中パラメータから兆パラメータまでの MoE アーキテクチャをカバーします。全体的な結果は次のとおりです。

ワットあたりの AI ワークロードが 1.5 ~ 1.9 倍に増加

エンドツーエンドのレイテンシが 1.7 ~ 3.6 分の 1 に削減

高度にインタラクティブなワークロードでのパフォーマンスが 2.1 ~ 4.1 倍向上


前述の 1459 トークンは GPT-OSS 120B で測定されました。

ワード間隔に換算すると、2 つのトークン間の時間はわずか 0.69 ミリ秒です。

人は通常、1 秒間に約 5 ~ 6 語を読みますが、1 秒間に 1,459 語を吐き出します。目が追いつかないし、画面が読み取れない。


緑はハラペーニョ、青は入手可能な中で最も強いです。 3 つのモデルはそれぞれ 2.7 倍、4.1 倍、3.8 倍高速です

チャットでは 1.65 秒と 5.99 秒の間の 4 秒の差は許容できますが、エージェントで使用する場合は別の問題です。タスクには連続した数十のステップが必要なので、その差を何倍にもする必要があります。

その後、ネットワーク全体が 104.3 回回転していると言われました。

これが正確に意味するのは、GB300 を最速のデコード速度 (1 秒あたり 169 トークン) に引き上げると、その時点での Jalapeño のスループットは 104.3 倍になるということです。

この傾向は 3 つのモデルに当てはまり、GPT-OSS は 53.7 倍、1T モデルは 56.1 倍に達しました。



同じモデルの場合、必要な単語生成速度が上がるにつれて、先頭マージンは 1.7 倍から 104.3 倍に増加します。

言い換えれば、相手が限界に達して喘ぎ始める場所は、まさに冷静に巡航している場所なのです。

ピーク値がそれぞれの最良動作点に基づいて計算される場合、その差は 3 つのモデルでそれぞれ 1.9 倍、1.7 倍、1.5 倍とはるかに小さくなります。


実際に距離を生み出すのは、インタラクションの多いシーンです


左の図の横軸はワード出力速度、右の図の横軸は完全なリクエストの遅延です。緑のハラペーニョが曲線全体で青の GB200 を押します

SemiAnalysis では、電源、放熱、ネットワークを考慮し、それを各チップに分散します。

その結果、ハラペーニョはユニットあたり 1.125 キロワット、GB200 は 1.87 キロワット、ベラ ルービンは 3.3 キロワットです。

この口径で GPT-OSS を実行すると、Jalapeño は 1 メガワットあたり 1 秒あたり約 5,300 万のトークンを吐き出しますが、GB200 NVL72 は約 1,000 万トークンしか吐き出しません。


紫色はハラペーニョ、横軸はインタラクション速度、縦軸はメガワット/秒あたり吐き出されるトークンの数です。

コストの点では、チップ 1 時間あたりの総所有コストは、ハラペーニョの場合は 1.56 ドルで、H100 の場合は 1.55 ドルとほぼ同じですが、ベラ ルービンの場合は 3.61 ドルです。


緑はベラ・ルービン、紫はハラペーニョです。毎秒 200 トークンの後、紫は緑の手の届かない場所まで移動しました。

最も恐ろしいのは、これらの結果がハラペーニョの全力ではないということです。

投機的なデコードやトークン予測も有効にしません。また、プレフィルとデコードの個別のデプロイメントも実行しません。ただし、画像内の他のすべてのチップは独自の最適な構成を実行しており、有効にする必要がある最適化が除外されることはありません。

セミアナリシスは、投機的デコードだけでトークンあたりのコストを 2/3 以上削減できると推定しています。


ハラペーニョは「ドゥーム スレイヤー」を実行することもできます

02

9 か月間で、GPT-Astra はテープアウト室まで作業を続けました

そのような場合、OpenAI の設計からテープアウトまでに要した時間はわずか 9 か月です。これに対し、業界における一般的な期間は 18 ~ 36 か月です。

ASIC を行ったことがある人なら誰でも、このサイクルで最も大変な作業が検証であることを知っています。シミュレーションは何度も実行する必要があり、場所を変更すると最初からやり直す必要があります。

OpenAI が「不正行為」できる理由は、最も強力なモデルをテープアウト ルームに招待するためです—

ハラペーニョの開発に貢献したモデルは GPT-Astra と呼ばれ、外部で噂されている GPT-6 です。





プロセス全体を通じて、GPT-Astra は基本的にチームの最強のサポートとなりました。

実装ソリューションの探索に役立ち、「設計、測定、検証」のサイクル全体を限界まで絞り込み、演算回路を微細に操作することもできます。

マイクロマネジメントはどの程度行われていますか? SemiAnalysis が調べた数値によると、AI 支援設計により SIMD ユニットの面積が 8%、マトリックス エンジンの面積が 10% 削減されます。

同時に、これらのモジュールはタイミングと消費電力の点で最初のバージョンよりも優れています。


コンピューティング ダイは中央にあり、両側に 3 つの HBM4 があり、一番上のものが I/O チップです

主な計算ダイは約 840 平方ミリメートルで、EUV リソグラフィー装置のマスク限界は 858 平方ミリメートルです。このシリコン片は、物理的な天井からわずか 18 平方ミリメートルしか離れていません。

フォトリソグラフィー装置が描画に使用できる領域は基本的に占有されており、何も残っていないと言えます。


ピンクの行はハラペーニョ、右端の 3 つの列はワットあたりの HBM 帯域幅、ワットあたりの FLOP および計算電力対帯域幅比です。

ワットあたりの HBM 帯域幅に関しては、ハラペーニョは 22、2 位のルービンは 11.1、GB300 はわずか 5.71 です。 2位と比べてちょうど2倍の高さです。

ワットあたりの FLOP は 19.1、ルービン数は 19.4 です。この 2 つはほぼ互角ですが、ルービンは 1,800 ワット以上を消費しますが、ハラペーニョは 700 ワットしか消費しません。

これは A0 ステップで実行しているだけです。 B0 はすでに工場内にあり、ワットあたりのパフォーマンスは A0 よりも約 25% 高くなります。

このようにして、OpenAI は、Codex と GPT-Astra の強力な組み合わせを利用して、当初計画されていなかった 3 つのオープン ソース モデルをわずか 2 か月で高性能な状態に変換しました。

さらに恐ろしいのは、最もパフォーマンスを必要とする「attention」および MoE モジュールでは、AI によって入力されたコードが人間のトップ エキスパートよりも 1.5​​ ~ 1.8 倍高速に実行されることです。

AI がチップを設計し、チップが AI を実行し、AI が戻ってチップ上の AI を最適化します。

このフライホイール、OpenAI はすでに回転しています。



CUDA 堀、死んだ?

NVIDIA の最も深い堀は常に CUDA でした。

過去 20 年間にわたって蓄積されたソフトウェア スタックは、世界中のエンジニアの筋肉の記憶を培ってきました。ハードウェアが変更されるたびに、ハードウェアを破壊して最初からやり直す必要があります。

セミアナリシスは記事の中で、CUDA の堀は死んだ可能性があると非常に重い判断を下しました。


その理由はスピードです。

彼らはさらに、胸が張り裂けるような比較も追加しました。Nvidia の Rubin は、実際には、Jalapeño よりも 1 か月早く CoWoS のテープアウトを完了しました。

しかし、これまでのところ、外部の世界が見ることができる唯一の Rubin の結果は、CoreWeave エンジニアリング サンプルからのデータです。 Nvidia は、OpenAI のようなランダム テストのために第三者を研究所に投入しません。

つまり、問題はソフトウェアの起動速度にあります。 NVIDIA のハードウェア自体には何も問題はありません。

ゼロから始めると、OpenAI にも利点が生まれます。歴史的な荷物を運ぶ必要はなく、建築は白紙の紙に完全に描くことができます。

SemiAnalysis の最後の文は非常に生々しいです —

彼らは、NVIDIA GPU で実行される GPT-5.6 Sol などの OpenAI モデルが、CUDA の堀を真に脅かすチップの設計に使用されていると言います。 NVIDIA 独自の GPU は、独自の「後継」をリアルタイムで生成しています。


03

10 ギガワット、これはほんの始まりにすぎません

ハラペーニョは前線での最初のショットにすぎません。

昨年 10 月、OpenAI と Broadcom は大きな動きを見せ、10GW カスタム アクセラレータの大規模な協力注文に署名しました。


ウルトラマンとブロードコム CEO の陳富陽氏が、「ハラペーニョ インテリジェンス プロセッサー」と書かれた銘板が付いたハラペーニョ ウエハースを披露しました。

10GW レベルは、フル稼働で稼働している原子力発電所 10 基にほぼ相当します。


左側に CPU メイン キャビネット、右側に ASIC キャビネット、1 つのキャビネットに 128 個のチップが搭載されており、2 つのキャビネットの合計は約 160 キロワットです

ちなみに、CPU を乗せるトレイをカツ、チップをヴィンダルーインドカレー、スイッチをチャナひよこ豆といいます。日本食からスパイシーなインド料理まで、ぜひこのシステムを覚えておいてほしいと思っています。

そして、ハラペーニョはロードマップ上の第一世代にすぎないと、OpenAI はレポートで明確に述べています—

Gen2 はすでに鋭意開発中であり、Gen3 も形になりつつあります。

量産は 2027 年まで徐々に増加せず、次のマイルストーンは 100 メガワットです。


しかし、つい今日、OpenAI のデータセンター マネージャー、クリス マローン氏が失踪したことが明らかになりました。

マローンはスターゲイトの責任者です。

現在、IPO はますます近づいています。この時点で、コンピューティング インフラストラクチャの主要な指揮官を失ったことで、人々は OpenAI の背後にある底流について疑問を抱くようになりました。


もちろん、ハラペーニョ 1 つだけでは Nvidia を打倒するのに十分ではありません。

しかし、本当の危険信号は、OpenAI がモデル、チップ、ソフトウェアを加速するフライホイールにねじ曲げていることです。

現在のハラペーニョは第 1 世代にすぎず、その後に Gen2、Gen3、そして 10GW のコンピューティング能力が続きます。たとえ中核幹部が去ったとしても、この路線の前進を止めることはできない。

NVIDIA は依然として王座に座しています。

今回だけは、交換品はドアの外に並ばず、すでにコンピュータ室に流れ込んでいました。

Nvidia のライバル各社がついに独自の Nvidia を構築し始めました。

関連タグ

関連記事

コメント

0/500
验证码
コメントなし