大規模な人工知能モデルをトレーニングする過程で、スーパーコンピューティング サービスやメモリを購入することも、コンピューティング能力に対する不安を効果的に軽減する新しい方法になりつつあります。最近、中国工程院の学者で清華大学コンピューターサイエンス学部の教授である鄭偉民氏は、新浪科技との通信の中で、「かつては大規模なモデルのトレーニングには数十億ドルの費用がかかったが、スーパーコンピューターで大規模なモデルをトレーニングすると、価格はNVIDIAのわずか6分の1になる」と指摘した。


さらに、鄭偉民氏は、AI推論の発展における新たなトレンド「預金ベースの取引所」についても指摘した。同氏は、清華大学とAIユニコーン企業Dark Side of the Moonが共同開発したMooncakeテクノロジーフレームワークを例に挙げ、このテクノロジーが「デポジットツーデポジット」の考え方に基づいており、Dark Side of the Moonのキミインテリジェントアシスタントがコンピューティングパワーの逼迫した需要を緩和し、それによってサーバーのダウンタイムを回避できるようにする原理を紹介した。

「大規模モデルのトレーニングをスーパーコンピューターに移行、価格は NVIDIA のわずか 1/6」

Zheng Weimin 氏は、ChatGPT のリリース後、世界のテクノロジー企業が急速に追いつき、今年の大型モデルには 2 つの特徴があると見ました。1 つは、基本的な大型モデルが、テキストだけでなく画像やビデオなども含めたマルチモーダル状態に入ったことです。第二に、実際に活用されており、大型モデル+金融、大型モデル+医療、大型モデル+自動車、大型モデル+インテリジェント製造など、さまざまな業界の実態と統合されつつあります。

「大型モデルは、国家経済のGDPや国民の生活水準と本当に密接に結びついています。私たちの基本的な大型モデルのレベルはまだ米国に少し遅れていると常々思っていましたが、『大型モデル+』に関しては、依然として米国を超えたいと考えています。」鄭偉民氏は語った。

ただし、大規模モデルの実際のアプリケーション プロセスでは、データの取得、データの前処理、モデルのトレーニング、モデルの微調整、モデルの推論など、ライフサイクル全体で大量のコンピューティング リソースが必要になります。より効率的で信頼性の高い AI ラージ モデル コンピューティング リソースを低コストで入手する方法は、すべての企業が検討している問題となっています。

海外でハイエンドのチップを入手するのが難しいため、大規模なAIモデルのトレーニングによってもたらされる膨大な計算能力需要を満たすために中国で現在開発されている主なソリューションの1つは、キロカードおよび10,000枚のカードのクラスターを構築し、異種カードの共同トレーニングのための大規模なチップと半導体のスタッキングを通じて複数のメーカーからチップを購入し、大規模モデル製品のトレーニングのための膨大な計算能力需要を満たすというものである。ただし、Zheng Weimin 氏の見解では、この方法は計算能力不足の問題を解決できますが、いくつかの欠点もあります。

まず、国内のWankaシステムを構築するためには、構築することが重要ですが、それをうまく活用するのが難しいです。 Zheng Weimin 氏は、ハイパフォーマンス コンピューティングにおける自身の経験から次のように述べています。「2,000 枚のカード システムを構築し、そのうち 1,000 枚は NVIDIA チップを使用し、残りの 1,000 枚は他のメーカーのチップを使用しました。システムは構築されて実行されましたが、最終的には、これらのチップのパフォーマンスが異なり、一部のチップは能力が低いことが判明しました。一部はより能力が高いことがわかりました。タスクは 2,000 の部分に分割され、そのうちの 1,000 は小さなタスクに分割され、残りの 1,000 はより大きなタスクに分割されます。これが動的である場合、処理のために直接 2,000 の小さな部分に分割されます。」

Zheng Weimin氏は、大規模なコンピューティングクラスターの構築にはバレル効果があると指摘した。コンピューティング カードには、強力な機能を持つものもあれば、弱いものもあります。バケツ全体にどれだけの水が入るかが最終的にショートボードで決まるのと同じで、ボードがいくら長くても意味がありません。 「したがって、1,000 個の古い GPU と 1,000 個の新しい GPU の合計パフォーマンスは、2,000 個の古い GPU のパフォーマンスよりもわずかに低く、大規模なコンピューティング クラスターを構築するコストもかなり高くなります。」

Zheng Weimin 氏の見解では、異種カードの大規模な共同トレーニングにおいて静的環境で最高のパフォーマンスを達成することは困難であり、非経済的です。リモートカードが関係する場合はさらに困難になります。データは北京から貴州に送信され、結果は貴州で生成されて上海に送信されます。それに伴う時間コストは非常に高くなります。 「お金が少ない人はやる必要はないが、お金が多い人は試してみてもいいだろう。」

Zheng Weimin 氏は、企業が AI の大規模モデルのトレーニングにスーパーコンピューティングを使用してみることを提案しました。 「我が国には14億台のスーパーコンピュータシステムがあり、その資金は国が支払っている。一部のマシンはまだ少し余っている。国内のスーパーコンピュータマシンは安いからだ。マシンのコストを回収しても利益を上げなければならないNVIDIAとは違い、みんな大規模なモデルトレーニングをして青島Sunwayスーパーコンピュータに行き、価格は6分の1で十分だ。」鄭偉民氏は語った。

「ストレージからデポジットへの変換により、AI 推論コストを効果的に削減できます。」

実際、大規模モデルの実際のアプリケーション プロセスでは、データの取得、データの前処理、モデルのトレーニング、モデルの微調整、モデルの推論など、ライフサイクル全体を通じて大量のコンピューティング リソースが必要になります。また、膨大な計算結果を保存するには大量のストレージリソースが必要です。特にモデル推論の過程では、いかに多くのデータを蓄積し、高速に送信し、コストパフォーマンスを高くするかが業界全体で考えられる課題となっています。

Zheng Weimin 氏は以前、「AI ストレージは大規模な人工知能モデルの重要なベースです。ストレージ システムは大規模なモデルのライフ サイクルのあらゆるリンクに存在し、大規模なモデルの重要なベースです。ストレージを使用して計算を実行し、ストレージを使用して計算を変換することで、高度な AI ストレージはトレーニング クラスターの可用性を向上させ、推論コストを削減し、ユーザー エクスペリエンスを向上させることができます。」と公に述べています。

Sina Technology とのコミュニケーションにおいて、Zheng Weimin 氏は「デポジットからコンバージョンまで」という基本原則を共有しました。同氏は、「大規模なモデルは、トレーニングでも推論でも多くの計算能力を必要とし、また、大規模モデルによってトレーニングされた膨大なパラメータや、推論プロセス中に生成される一部のプロセスデータを保存するために大量のストレージも必要とします。」と指摘しました。ただし、トレーニングまたは推論プロセス全体で保存する必要があるデータが増えると、メモリ リソースの不足が生じ、最終的には大規模モデルのパフォーマンス向上の「負担」になります。

Zheng Weimin 氏によると、上記の問題を解決するために、清華大学は 2 つの方法を考えました。1 つは、推論プロセスでは、現在主に推論カードが動作し、ホスト CPU とホスト メモリは使用されません。したがって、推論プロセスでホスト上のメモリを使用する方法を見つけて、メモリ使用率を向上させることができます。パフォーマンスを向上させながら、コストも節約します。推論カードを継続的に購入する資本コストが削減されます。次に、推論プロセス中に生成され、ユーザーによって共有される共通コンテンツが保存されます。必要な推論プロセス中に生成されたデータを保存しておくことで、その後同様の問題が発生したときにそのデータを直接呼び出すことができ、同様な問題が発生するたびに推論プロセスを直接省略できるため、効率が向上し、リソースが節約されます。

清華大学とDark Side of the Moonが共同開発したMooncakeテクノロジーフレームワークを例に挙げ、Zheng Weimin氏は、「さまざまなユーザーとキミとの間の会話の公開コンテンツを抽出して保存することで、ユーザーが質問するたびに再生成するプロセスが削減されるだけでなく、多くのコンピューティングカードが節約され、キミへの過剰なアクセスによって引き起こされる『アクセス遅延』や『ダウンタイム』などの問題も軽減される」と指摘した。

本文丨新浪科技 周文夢