要約:
OpenAI の最初のチップ生産が実際に NVIDIA シリーズ全体を打ち破ったと信じられますか? !ちょうど今、OpenAI の最初の自社開発チップである Jalapeño が、NVIDIA GB200 および GB300 を完全に上回る AI 推論パフォーマンスという測定結果の最初のバッチを引き渡しました。


測定された速度で直接離陸してください。
Jalapeño は 1 秒間に 1,459 トークンを吐き出すことができますが、Nvidia GB200 は半分にも満たない 535 トークンしか吐き出すことができません。
「Pepper」がタスクを完了するのにかかる時間はわずか 1.65 秒ですが、GB300 では 6 秒近くかかり、完全に 3.6 倍の差があります。
最も残酷なことは、たとえ GB300 が最速のデコード速度に達したとしても、Jalapeño のスループットは依然としてそれよりも 104.3 倍高いということです。
ハラペーニョの公称消費電力はわずか 700 W ですが、GB300 の公称消費電力は 1400 W で、ちょうど半分です。
有名な半導体アナリストのディラン・パテル氏は、「打倒されたのはブラックウェルだけではなく、Nvidia の Rubin チップさえも追い越された」と厳しく言いました。

一時期、AI サークル全体が爆発的に広がりました。ネチズンは、OpenAI が非常にクレイジーだったので Nvidia も敗北したことに驚嘆しました。
ウルトラマンの発言は横暴でありながらも抑制的でした、「私たちはチップを作りました、それはとんでもなく速いのです」!


01
「唐辛子」が Nvidia の主力製品をひっくり返した
これは OpenAI 自体について話しているわけではありません。
セミアナリシスは実際の測定のために研究室に入り、彼らが書いた結論は—
ハラペーニョは、これまでにテストした Nvidia、AMD、Google のすべてのチップを破りました。
その違いはどれくらいですか? Nvidia の最新の Vera Rubin は、ほぼ 3 つのハラペーニョを食べるのに十分な電力を消費します。

テスト中に、OpenAI は、GPT-OSS 120B、670B および 1T モデルの 3 つの公開モデルを実行するように選択しました。
このラウンドのテストは、中パラメータから兆パラメータまでの MoE アーキテクチャをカバーします。全体的な結果は次のとおりです。
ワットあたりの AI ワークロードが 1.5 ~ 1.9 倍に増加
エンドツーエンドのレイテンシが 1.7 ~ 3.6 分の 1 に削減
高度にインタラクティブなワークロードでのパフォーマンスが 2.1 ~ 4.1 倍向上

前述の 1459 トークンは GPT-OSS 120B で測定されました。
ワード間隔に換算すると、2 つのトークン間の時間はわずか 0.69 ミリ秒です。
人は通常、1 秒間に約 5 ~ 6 語を読みますが、1 秒間に 1,459 語を吐き出します。目が追いつかないし、画面が読み取れない。

緑はハラペーニョ、青は入手可能な中で最も強いです。 3 つのモデルはそれぞれ 2.7 倍、4.1 倍、3.8 倍高速です
チャットでは 1.65 秒と 5.99 秒の間の 4 秒の差は許容できますが、エージェントで使用する場合は別の問題です。タスクには連続した数十のステップが必要なので、その差を何倍にもする必要があります。
その後、ネットワーク全体が 104.3 回回転していると言われました。
これが正確に意味するのは、GB300 を最速のデコード速度 (1 秒あたり 169 トークン) に引き上げると、その時点での Jalapeño のスループットは 104.3 倍になるということです。
この傾向は 3 つのモデルに当てはまり、GPT-OSS は 53.7 倍、1T モデルは 56.1 倍に達しました。


同じモデルの場合、必要な単語生成速度が上がるにつれて、先頭マージンは 1.7 倍から 104.3 倍に増加します。
言い換えれば、相手が限界に達して喘ぎ始める場所は、まさに冷静に巡航している場所なのです。
ピーク値がそれぞれの最良動作点に基づいて計算される場合、その差は 3 つのモデルでそれぞれ 1.9 倍、1.7 倍、1.5 倍とはるかに小さくなります。

実際に距離を生み出すのは、インタラクションの多いシーンです

左の図の横軸はワード出力速度、右の図の横軸は完全なリクエストの遅延です。緑のハラペーニョが曲線全体で青の GB200 を押します
SemiAnalysis では、電源、放熱、ネットワークを考慮し、それを各チップに分散します。
その結果、ハラペーニョはユニットあたり 1.125 キロワット、GB200 は 1.87 キロワット、ベラ ルービンは 3.3 キロワットです。
この口径で GPT-OSS を実行すると、Jalapeño は 1 メガワットあたり 1 秒あたり約 5,300 万のトークンを吐き出しますが、GB200 NVL72 は約 1,000 万トークンしか吐き出しません。

紫色はハラペーニョ、横軸はインタラクション速度、縦軸はメガワット/秒あたり吐き出されるトークンの数です。
コストの点では、チップ 1 時間あたりの総所有コストは、ハラペーニョの場合は 1.56 ドルで、H100 の場合は 1.55 ドルとほぼ同じですが、ベラ ルービンの場合は 3.61 ドルです。

緑はベラ・ルービン、紫はハラペーニョです。毎秒 200 トークンの後、紫は緑の手の届かない場所まで移動しました。
最も恐ろしいのは、これらの結果がハラペーニョの全力ではないということです。
投機的なデコードやトークン予測も有効にしません。また、プレフィルとデコードの個別のデプロイメントも実行しません。ただし、画像内の他のすべてのチップは独自の最適な構成を実行しており、有効にする必要がある最適化が除外されることはありません。
セミアナリシスは、投機的デコードだけでトークンあたりのコストを 2/3 以上削減できると推定しています。

ハラペーニョは「ドゥーム スレイヤー」を実行することもできます
02
9 か月間で、GPT-Astra はテープアウト室まで作業を続けました
そのような場合、OpenAI の設計からテープアウトまでに要した時間はわずか 9 か月です。これに対し、業界における一般的な期間は 18 ~ 36 か月です。
ASIC を行ったことがある人なら誰でも、このサイクルで最も大変な作業が検証であることを知っています。シミュレーションは何度も実行する必要があり、場所を変更すると最初からやり直す必要があります。
OpenAI が「不正行為」できる理由は、最も強力なモデルをテープアウト ルームに招待するためです—
ハラペーニョの開発に貢献したモデルは GPT-Astra と呼ばれ、外部で噂されている GPT-6 です。


プロセス全体を通じて、GPT-Astra は基本的にチームの最強のサポートとなりました。
実装ソリューションの探索に役立ち、「設計、測定、検証」のサイクル全体を限界まで絞り込み、演算回路を微細に操作することもできます。
マイクロマネジメントはどの程度行われていますか? SemiAnalysis が調べた数値によると、AI 支援設計により SIMD ユニットの面積が 8%、マトリックス エンジンの面積が 10% 削減されます。
同時に、これらのモジュールはタイミングと消費電力の点で最初のバージョンよりも優れています。

コンピューティング ダイは中央にあり、両側に 3 つの HBM4 があり、一番上のものが I/O チップです
主な計算ダイは約 840 平方ミリメートルで、EUV リソグラフィー装置のマスク限界は 858 平方ミリメートルです。このシリコン片は、物理的な天井からわずか 18 平方ミリメートルしか離れていません。
フォトリソグラフィー装置が描画に使用できる領域は基本的に占有されており、何も残っていないと言えます。

ピンクの行はハラペーニョ、右端の 3 つの列はワットあたりの HBM 帯域幅、ワットあたりの FLOP および計算電力対帯域幅比です。
ワットあたりの HBM 帯域幅に関しては、ハラペーニョは 22、2 位のルービンは 11.1、GB300 はわずか 5.71 です。 2位と比べてちょうど2倍の高さです。
ワットあたりの FLOP は 19.1、ルービン数は 19.4 です。この 2 つはほぼ互角ですが、ルービンは 1,800 ワット以上を消費しますが、ハラペーニョは 700 ワットしか消費しません。
これは A0 ステップで実行しているだけです。 B0 はすでに工場内にあり、ワットあたりのパフォーマンスは A0 よりも約 25% 高くなります。
このようにして、OpenAI は、Codex と GPT-Astra の強力な組み合わせを利用して、当初計画されていなかった 3 つのオープン ソース モデルをわずか 2 か月で高性能な状態に変換しました。
さらに恐ろしいのは、最もパフォーマンスを必要とする「attention」および MoE モジュールでは、AI によって入力されたコードが人間のトップ エキスパートよりも 1.5 ~ 1.8 倍高速に実行されることです。
AI がチップを設計し、チップが AI を実行し、AI が戻ってチップ上の AI を最適化します。
このフライホイール、OpenAI はすでに回転しています。


CUDA 堀、死んだ?
NVIDIA の最も深い堀は常に CUDA でした。
過去 20 年間にわたって蓄積されたソフトウェア スタックは、世界中のエンジニアの筋肉の記憶を培ってきました。ハードウェアが変更されるたびに、ハードウェアを破壊して最初からやり直す必要があります。
セミアナリシスは記事の中で、CUDA の堀は死んだ可能性があると非常に重い判断を下しました。

その理由はスピードです。
彼らはさらに、胸が張り裂けるような比較も追加しました。Nvidia の Rubin は、実際には、Jalapeño よりも 1 か月早く CoWoS のテープアウトを完了しました。
しかし、これまでのところ、外部の世界が見ることができる唯一の Rubin の結果は、CoreWeave エンジニアリング サンプルからのデータです。 Nvidia は、OpenAI のようなランダム テストのために第三者を研究所に投入しません。
つまり、問題はソフトウェアの起動速度にあります。 NVIDIA のハードウェア自体には何も問題はありません。
ゼロから始めると、OpenAI にも利点が生まれます。歴史的な荷物を運ぶ必要はなく、建築は白紙の紙に完全に描くことができます。
SemiAnalysis の最後の文は非常に生々しいです —
彼らは、NVIDIA GPU で実行される GPT-5.6 Sol などの OpenAI モデルが、CUDA の堀を真に脅かすチップの設計に使用されていると言います。 NVIDIA 独自の GPU は、独自の「後継」をリアルタイムで生成しています。

03
10 ギガワット、これはほんの始まりにすぎません
ハラペーニョは前線での最初のショットにすぎません。
昨年 10 月、OpenAI と Broadcom は大きな動きを見せ、10GW カスタム アクセラレータの大規模な協力注文に署名しました。

ウルトラマンとブロードコム CEO の陳富陽氏が、「ハラペーニョ インテリジェンス プロセッサー」と書かれた銘板が付いたハラペーニョ ウエハースを披露しました。
10GW レベルは、フル稼働で稼働している原子力発電所 10 基にほぼ相当します。

左側に CPU メイン キャビネット、右側に ASIC キャビネット、1 つのキャビネットに 128 個のチップが搭載されており、2 つのキャビネットの合計は約 160 キロワットです
ちなみに、CPU を乗せるトレイをカツ、チップをヴィンダルーインドカレー、スイッチをチャナひよこ豆といいます。日本食からスパイシーなインド料理まで、ぜひこのシステムを覚えておいてほしいと思っています。
そして、ハラペーニョはロードマップ上の第一世代にすぎないと、OpenAI はレポートで明確に述べています—
Gen2 はすでに鋭意開発中であり、Gen3 も形になりつつあります。
量産は 2027 年まで徐々に増加せず、次のマイルストーンは 100 メガワットです。

しかし、つい今日、OpenAI のデータセンター マネージャー、クリス マローン氏が失踪したことが明らかになりました。
マローンはスターゲイトの責任者です。
現在、IPO はますます近づいています。この時点で、コンピューティング インフラストラクチャの主要な指揮官を失ったことで、人々は OpenAI の背後にある底流について疑問を抱くようになりました。

もちろん、ハラペーニョ 1 つだけでは Nvidia を打倒するのに十分ではありません。
しかし、本当の危険信号は、OpenAI がモデル、チップ、ソフトウェアを加速するフライホイールにねじ曲げていることです。
現在のハラペーニョは第 1 世代にすぎず、その後に Gen2、Gen3、そして 10GW のコンピューティング能力が続きます。たとえ中核幹部が去ったとしても、この路線の前進を止めることはできない。
NVIDIA は依然として王座に座しています。
今回だけは、交換品はドアの外に並ばず、すでにコンピュータ室に流れ込んでいました。
Nvidia のライバル各社がついに独自の Nvidia を構築し始めました。
コメント