NVIDIA は最近、最新の Rubin GPU アーキテクチャの詳細な分析を実施し、マルチラック、マルチシステム、データセンター レベルでの大規模コンピューティングの実現における大きな進歩を実証しました。同社のテクノロジー進化における重要なマイルストーンとして、このアクセラレータは、まばらな NVFP4 操作で最大 50 ペタ FLOPS のコンピューティング パワーを提供できます。

フルパワーの場合、Rubin GPU は最大 224 個のストリーミング マルチプロセッサ (SM) と 288 GB の HBM4 メモリを統合します。 3,360 億個のトランジスタを備えた Nvidia は、第 3 世代の Transformer エンジンを備えた 896 個の tensor コアも装備しました。膨大な生のコンピューティング能力を解放するために、NVIDIA は GPU リソースを集中型 L2 キャッシュを備えたグラフィックス プロセッサ クラスターに分割し、GigaThread エンジンで補完してワークフローを調整し、リソース使用率を最適化します。さらに、MIG コントロール パーティショニング機能により、この GPU を複数の仮想 GPU にパーティショニングできます。これは、最新の CPU が仮想コアを処理する方法と同様に機能します。

メモリ構成に関しては、Nvidia はメモリ パートナーと協力して、12 層スタック モジュールを通じて 288 GB の HBM4 メモリを提供しました。専用の HBM コントローラーは物理層と連携して、業界内で非常に競争力の高い 1 秒あたり最大 22 TB のピーク メモリ帯域幅を実現します。テンソル メモリ マネージャーはデータ転送効率を向上させるためにアップグレードされ、GPU 全体の垂直方向の拡張と通信は NVLink 6 によって完全に管理されます。NVLink 6 を使用すると、完全に相互接続された GPU 通信のアーキテクチャ上の帯域幅は 3600 GB/秒に達し、NVLink-C2C チップ間相互接続テクノロジは 1800 GB/秒の CPU-GPU 通信帯域幅を達成します。 Nvidia には、外部デバイスとのデータ交換用に 256 GB/秒の帯域幅を備えた PCIe Gen 6 スイッチも内蔵されています。

スケールアップ通信は NVIDIA の中核的な強みの 1 つであり、GPU がラックスケール システム内の他の GPU と効率的かつシームレスに通信できるようにします。従来の GPU 間通信では調整と同期が必要になることが多く、システムがデータ送信を待って停止すると遅延が発生します。この問題点に対処するために、Rubin アーキテクチャではデバイス開始の通信メカニズムを導入し、各 GPU がデータ送信を独立して管理できるようにすることで、外部の最適化の必要性を排除し、レイテンシーを効果的に削減します。

このような高性能システムには膨大な電力消費が伴うことが多く、1 つの NVL72 ラックには 72 個の GPU が統合されています。 Vera Rubin NVL72 システム用に、NVIDIA はすべてのシステム コンポーネントを単一の固定電力エンベロープに統合するインテリジェントな電力平滑化テクノロジを開発しました。たとえば、人工知能ワークロードを実行する場合、CPU を待機するアイドル状態からフルロードされた GPU までの間で電力要件が大きく変動する可能性があります。インテリジェントな電力平滑化テクノロジーにより、Vera Rubin NVL72 システムの平均消費電力は、前世代の Grace Blackwell NVL72 と比較して約 10% 削減され、ピーク 50 ミリ秒の電力は約 20% 削減されます。その電力バジェットの最適化は、NVIDIA DSX MaxLPS テクノロジーによってさらにサポートされています。