Nvidiaが「Rubin CPX」AIアクセラレータプロジェクトを再開し、168GB HBM4メモリに切り替えると報じられている

📅 2026-09-01

要約:

サプライ チェーン アナリストの Ming-Chi Kuo 氏によると、NVIDIA の以前棚上げされていた「Rubin CPX」AI アクセラレータ プロジェクトが再開され、メモリ アーキテクチャが再設計されました。この製品は当初、128GB GDDR7 ビデオ メモリを搭載する予定でしたが、168GB HBM4 高帯域幅メモリが搭載されました。

Nvidia は昨年末、主に大規模なエージェント人工知能ワークロード向けに、Rubin GPU ファミリに基づく専用アクセラレータを開発する計画を発表しました。このプロジェクトは発表後、一時的に棚上げされたと報じられていたが、Nvidiaは再計画を完了したようだ。 Rubin CPX は独立したラックに導入され、各ラックは 64 ~ 256 個の独立した CPX GPU で構成できます。

デコードタスクを担当する従来の Rubin GPU とは異なり、CPX GPU は主に大規模な言語モデルの推論プロセスの「事前入力」段階で使用され、入力コンテキストと KV キャッシュの処理を担当します。 NVIDIA は、事前入力タスクとデコード タスクを分離しようとしています。CPX GPU が事前入力作業を担当し、次に通常の Rubin GPU がデコードを担当することで、全体的な推論効率が向上します。

8 つの CPX GPU を搭載したラック トレイは、最大 1.34 TB の長いコンテキスト事前設定データと関連する KV キャッシュを処理でき、すべて HBM4 メモリに依存します。 HBM4 はより高いメモリ帯域幅を提供できるため、長いコンテキスト データの処理の高速化に役立ちます。以前の設計では統合された HBM4 が必要ではなかったため、Nvidia はチップのパッケージングも再設計する必要があり、TSMC の CoWoS-S または CoWoS-L の高度なパッケージング テクノロジを使用することが予想されます。

コンピューティング パフォーマンスの点では、Rubin CPX はモノリシック チップ設計を採用しており、30 ギガフロップスの NVFP4 コンピューティング パフォーマンス、つまり 30 PFLOPS を提供できます。このチップには、4 つの NVENC ビデオ エンコード エンジンと 4 つの NVDEC ビデオ デコード エンジンも統合されており、外部プロセッサに依存せずに、より効率的なマルチメディア関連のワークロードを完了できます。

大規模な言語モデルのパラメータ スケールが数兆レベルに近づくにつれ、事前入力タスクとデコード タスクを別のラックに引き渡すことで、トークンの生成と配信の速度が大幅に向上すると予想されます。 Nvidia は、デコード ラック内で CPX GPU と通常の Rubin GPU の比率を 1:1 に維持することも推奨しています。

関連タグ

関連記事

コメント

0/500
Captcha (click to refresh)
コメントなし